最近关注书生生态的朋友,大概率反复刷到过几个画面。WAIC 2026上,上海AI Lab亮出非Transformer的科学大模型。央视财经探访了首次对外开放的实验室。微博7月底又官宣ArchSpace,说要把大模型研发的全过程打开。知乎8月7日,官方正式开源了一个叫Mobius的新架构。知乎
信息量不小,但真正值得停下来看的,其实是一件事:这家实验室想把大模型的"记忆"和"思考"分开管。
先把三组能核实的数据摆出来
官方通稿里关于Mobius的表述其实很克制,给的是三组可核实的对比数据(对Transformer)。知乎
端到端推理效率提升近4倍;
只用60%的训练数据,就能达到相近的MMLU得分;
在部分知识组合泛化的Toy任务上,性能达到Transformer的2倍。

这里有两个词值得注意。一个是"端到端",指从输入到产出结果的整体效率,不是单点加速;另一个是"Toy任务",即简化的验证性任务,不能直接等同于"所有真实任务都有2倍提升"。官方没有回避这一点,算是比较诚实的表述。
Mobius到底把什么分开了
在Transformer里,知识和计算是揉在一起的:模型"记住"的东西分散在每一层的权重里,推理时只能一层一层往下走。按学术界对Transformer的主流理解,全连接层(FFN)负责记忆存储,注意力层(Attn)负责组合推理。知乎想让它多记一点,就要加参数、堆层数,推理跟着变慢;想塞进新知识,就得重新训练,还容易扰动旧能力——牵一发而动全身。
Mobius的做法,是把原本分散于各层的知识统一构建为"共享记忆池",使每一层注意力(Attention)都可以直接读取池中记忆资源。知乎换句话说:记忆归记忆,推理归推理。

分开之后,官方给了三个方向的好处:
推理更快:层数不变的情况下,单次前向传播能完成更多次知识遍历,长链条里更容易抓到关键线索;
知识更新更快:新知识写入路径清晰,局部调整不太扰动全局,对持续学习场景很关键;
组合泛化更强:知识不再受层级位置限制,可以跨领域自由组合——这正是科学发现这类探索性任务需要的能力。
官方亲口承认的那个代价
这部分我认为是全文最值得读的。官方明确说了,共享记忆池架构会带来更大的访存与通信压力,能力释放的上限依赖底层硬件与框架的联合优化,实验室也已联合昇腾基于Atlas 900 A3超节点开展深度适配,Xtuner训练框架和LMDeploy推理框架都完成了针对性调优,实现了Mobius在该硬件上的训练与推理。知乎翻译得直白一点:Mobius把压力从"算力"挪到了"访存"。这不是架构的缺陷,而是"分家"路线必须跨过的工程门槛。
换句话说,这不是一个"发布即完成"的架构,而是"发布才开始调优"的架构。想围观的,建议把它当成连续剧看。
放到时间线上,才知道这不是拍脑袋
上海AI Lab今年以来的动作,其实是连贯的一条线:
2月:1T参数MoE科学多模态大模型Intern-S1-Pro发布;
5月:Intern-S2-Preview开源;同月,实验室联合团队用"AI决策+自动化合成闭环"攻克KrF光刻胶树脂的稳定制备,进入客户端验证,是AI4S的标志性落地之一;
7月中旬WAIC:非Transformer科学大模型亮相。有社区解读称"397B参数在科学任务上追平了此前的万亿参数模型"。知乎注意:这是WAIC发布与社区解读口径,不是Mobius论文里的基准数据。书生·端砚科学发现平台更新到2.0;实验室首次对媒体开放;
7月29日:ArchSpace亮相——不只开源模型参数,全量Checkpoints、训练日志、架构取舍与实验过程全部公开。微博机器之心称之为打开大模型研发的"黑盒"。同日与中科曙光发布DeepLinkFabric超智融合算力架构;
8月7日:Mobius架构正式开源,并接入ArchSpace。

从"堆参数"到"改架构",他们押的是AI4S(科学智能)。实验室主任周伯文有个核心判断:科学研究是下一个Coding。知乎Mobius想解决的从失败中学习、长程推理、探索式学习,全都落在这条主线上。
其实有两条路线,Mobius不是唯一答案
面对Transformer计算效率、上下文承载、长程推理三大短板,行业里现在有两套思路:
一条是效率优化路线:稀疏注意力、线性注意力等,通过削减计算复杂度,让有限资源撑得起更大的模型;另一条是能力上限路线:像Mobius这样重起炉灶,先把架构的能力天花板抬上去。
上海AI Lab的态度很明确:前者解决"跑得动",后者决定"能走多远"。知乎这是合理的技术争论,不是已有定论的胜负——这也是它值得持续观察的原因。
谁该关注,关注什么
做AI4S、科研场景的:Mobius最大的想象空间是"新知识不用重训模型"。新学科只需在独立记忆模块中训练、按需接入,不会扰动基础模型的通用能力。知乎这条路线若成立,会直接改变科研场景的知识更新方式。
做部署与推理优化的开发者:盯住LMDeploy和Xtuner对Mobius的支持进度。访存优化一旦成熟,"小一号的模型跑出更好的效果"就是实打实的降本。
关注国产算力的:Mobius+昇腾Atlas 900 A3是"国产新架构+国产算力"双向调优的样本,后续性能数据值得跟。
只想看个趋势的:守着ArchSpace就行。官方承诺Mobius的完整方案、实验配置与训练链路将全部对外开放。知乎这种"过程开源"在行业里相当少见,值得看它走到哪一步。
我个人会继续盯三件事:ArchSpace的训练日志是否如期全量开放、397B科学模型的权重会不会开源、以及Toy任务之外有没有真实科研场景的基准测试出来。这三件事有下文,再来聊Mobius到底成没成。
最后留个讨论:你觉得下一代大模型的突破,会来自"把Transformer改得更快",还是"干脆不用Transformer"?评论区聊聊。