当前位置:
AIGC文章详情

书生把"记忆"和"思考"分家了:上海AI Lab开源Mobius,4倍效率不是白来的

源自25位全网作者

08-26 19:54

最近关注书生生态的朋友,大概率反复刷到过几个画面。WAIC 2026上,上海AI Lab亮出非Transformer的科学大模型。央视财经探访了首次对外开放的实验室。微博7月底又官宣ArchSpace,说要把大模型研发的全过程打开。知乎8月7日,官方正式开源了一个叫Mobius的新架构。知乎

信息量不小,但真正值得停下来看的,其实是一件事:这家实验室想把大模型的"记忆"和"思考"分开管。

先把三组能核实的数据摆出来

官方通稿里关于Mobius的表述其实很克制,给的是三组可核实的对比数据(对Transformer)。知乎

  • 端到端推理效率提升近4倍;

  • 只用60%的训练数据,就能达到相近的MMLU得分;

  • 在部分知识组合泛化的Toy任务上,性能达到Transformer的2倍。

书生把

这里有两个词值得注意。一个是"端到端",指从输入到产出结果的整体效率,不是单点加速;另一个是"Toy任务",即简化的验证性任务,不能直接等同于"所有真实任务都有2倍提升"。官方没有回避这一点,算是比较诚实的表述。

Mobius到底把什么分开了

在Transformer里,知识和计算是揉在一起的:模型"记住"的东西分散在每一层的权重里,推理时只能一层一层往下走。按学术界对Transformer的主流理解,全连接层(FFN)负责记忆存储,注意力层(Attn)负责组合推理。知乎想让它多记一点,就要加参数、堆层数,推理跟着变慢;想塞进新知识,就得重新训练,还容易扰动旧能力——牵一发而动全身。

Mobius的做法,是把原本分散于各层的知识统一构建为"共享记忆池",使每一层注意力(Attention)都可以直接读取池中记忆资源。知乎换句话说:记忆归记忆,推理归推理。

书生把

分开之后,官方给了三个方向的好处:

  1. 推理更快:层数不变的情况下,单次前向传播能完成更多次知识遍历,长链条里更容易抓到关键线索;

  2. 知识更新更快:新知识写入路径清晰,局部调整不太扰动全局,对持续学习场景很关键;

  3. 组合泛化更强:知识不再受层级位置限制,可以跨领域自由组合——这正是科学发现这类探索性任务需要的能力。

官方亲口承认的那个代价

这部分我认为是全文最值得读的。官方明确说了,共享记忆池架构会带来更大的访存与通信压力,能力释放的上限依赖底层硬件与框架的联合优化,实验室也已联合昇腾基于Atlas 900 A3超节点开展深度适配,Xtuner训练框架和LMDeploy推理框架都完成了针对性调优,实现了Mobius在该硬件上的训练与推理。知乎翻译得直白一点:Mobius把压力从"算力"挪到了"访存"。这不是架构的缺陷,而是"分家"路线必须跨过的工程门槛。

换句话说,这不是一个"发布即完成"的架构,而是"发布才开始调优"的架构。想围观的,建议把它当成连续剧看。

放到时间线上,才知道这不是拍脑袋

上海AI Lab今年以来的动作,其实是连贯的一条线:

  • 2月:1T参数MoE科学多模态大模型Intern-S1-Pro发布;

  • 5月:Intern-S2-Preview开源;同月,实验室联合团队用"AI决策+自动化合成闭环"攻克KrF光刻胶树脂的稳定制备,进入客户端验证,是AI4S的标志性落地之一;

  • 7月中旬WAIC:非Transformer科学大模型亮相。有社区解读称"397B参数在科学任务上追平了此前的万亿参数模型"。知乎注意:这是WAIC发布与社区解读口径,不是Mobius论文里的基准数据。书生·端砚科学发现平台更新到2.0;实验室首次对媒体开放;

  • 7月29日:ArchSpace亮相——不只开源模型参数,全量Checkpoints、训练日志、架构取舍与实验过程全部公开。微博机器之心称之为打开大模型研发的"黑盒"。同日与中科曙光发布DeepLinkFabric超智融合算力架构;

  • 8月7日:Mobius架构正式开源,并接入ArchSpace。

书生把

从"堆参数"到"改架构",他们押的是AI4S(科学智能)。实验室主任周伯文有个核心判断:科学研究是下一个Coding。知乎Mobius想解决的从失败中学习、长程推理、探索式学习,全都落在这条主线上。

其实有两条路线,Mobius不是唯一答

面对Transformer计算效率、上下文承载、长程推理三大短板,行业里现在有两套思路:

一条是效率优化路线:稀疏注意力、线性注意力等,通过削减计算复杂度,让有限资源撑得起更大的模型;另一条是能力上限路线:像Mobius这样重起炉灶,先把架构的能力天花板抬上去。

上海AI Lab的态度很明确:前者解决"跑得动",后者决定"能走多远"。知乎这是合理的技术争论,不是已有定论的胜负——这也是它值得持续观察的原因。

谁该关注,关注什么

  • 做AI4S、科研场景的:Mobius最大的想象空间是"新知识不用重训模型"。新学科只需在独立记忆模块中训练、按需接入,不会扰动基础模型的通用能力。知乎这条路线若成立,会直接改变科研场景的知识更新方式。

  • 做部署与推理优化的开发者:盯住LMDeploy和Xtuner对Mobius的支持进度。访存优化一旦成熟,"小一号的模型跑出更好的效果"就是实打实的降本。

  • 关注国产算力的:Mobius+昇腾Atlas 900 A3是"国产新架构+国产算力"双向调优的样本,后续性能数据值得跟。

  • 只想看个趋势的:守着ArchSpace就行。官方承诺Mobius的完整方案、实验配置与训练链路将全部对外开放。知乎这种"过程开源"在行业里相当少见,值得看它走到哪一步。

我个人会继续盯三件事:ArchSpace的训练日志是否如期全量开放、397B科学模型的权重会不会开源、以及Toy任务之外有没有真实科研场景的基准测试出来。这三件事有下文,再来聊Mobius到底成没成。

最后留个讨论:你觉得下一代大模型的突破,会来自"把Transformer改得更快",还是"干脆不用Transformer"?评论区聊聊。

内容由AI生成

精选参考来源

1. 让记忆回归记忆、让推理专注推理,上海AI实验室开源创新架构Mobius,探索破解长程推理与科学发现难题

2. 从「结果开源」到「过程开放」:书生开启「全开放预训练」开源新模式

3. 这一次,上海人工智能实验室不仅开源模型参数,更将大模型研发的「黑盒」打开。全量 Checkpoints、训练日志、内部架构采纳与取舍全过程实验全面公开。基模架构探索平台 ArchSpace 正式亮相,开启大模型开源全新阶段!当前,「下一个概念预测」模型(NCP)、深度注意力模型(Depth-Attention)等十余种架构创新提案正在开放验证。 告别「小道消息」与研发黑盒!上海AI实验室探索全开放预训练开源

4. Transformer上限触顶,Mobius能否引发下一代模型架构的革命?

5. 我在一个周末搞懂了 Mobius:上海 AI Lab 怎么把”记忆”和”思考”分家

6. 国产AI4Science大模型开源!Intern-S1:241B总参、28B激活,能看分子、蛋白质和地震信号,多项科学任务挑战闭源模型

7. 【#央视财经独家探访上海人工智能实验室##上海进入AI时间#】7月17日,2026世界人工智能大会在上海正式启幕,上海进入“AI时间”。央视财经独家探访首次对外开放的上海人工智能实验室——从底层软件到前沿硬件,顶尖科研机构的硬核实力,戳视频一探究竟↓#对话# 央视财经的微博视频

8. 【#来上海和最强大脑做科研搭子#】今天,上海人工智能实验室“上新”了一位最强科研“助教”—— 书生·科学发现平台2.0版“书生·端砚”。它整合了专业智能体和海量科研数据以及实验设备,能够为全球科研者提供从“假设到验证”的一站式科研支撑。在这位最强科研“搭子”的帮助下,SMG主播邢航亲身见证并体验了一款牙科麻醉药,从生成标准实验操作方案,到方案发给张江晶泰科技自主实验室启动验证环节的全过程。跨过黄浦江的这条闭环,证明了一件事——AI4S不是纸上谈兵,是已经在真实实验室里跑通的路径。#直击世界人工智能大会# 看看新闻Knews的微博视频

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章