大模型预训练一直有点像一间紧闭的暗室:外面只能看到发布时的权重、跑分榜单和寥寥几篇论文,数据怎么配比、训练在哪里翻过车、哪些超参数真的有效,统统看不到。现在,有人把门直接拆了。近日,斯坦福大学副教授 Percy Liang 宣布,开放实验室 Marin 启动 535B-A23B 大模型训练,并且全程公开。按照目前公布的计划,这款 MoE 模型总参数 5350 亿、每 Token 激活约 230 亿,准备了 18.75 万亿 Token 的训练数据,训练运行在11套NVIDIAGB200NVL72系统上,预计持续约3个月,总计算量约为2.7×1024FLOPs。36氪有媒体转述网友的形容:这就像顶级AI实验室内部原本紧闭的“暗室”突然被打开,所有人都能看到里面正在发生什么。机器之心

项目背后是谁
Marin 项目 2025 年 5 月发起,诞生于斯坦福大学基础模型研究中心 CRFM,发起公告由 David Hall、Percy Liang 以及来自斯坦福、OpenAthena 和开放社区的多位研究人员共同署名。

两位核心发起人中,Percy Liang 是 CRFM 主任,也是 Together AI 的联合创始人,同时还讲一门叫《CS336:从零构建语言模型》的公开课;David Hall 长期从事开放模型与数据基础设施工作。他们想回答的问题很直接:在算力高度集中、训练配方越来越封闭的当下,基础模型还能不能像开源软件一样被公开研究和共同建设。
不止又一次“开源模型”
理解这次的差别,可以把开放程度拆成三层。
第一层是开放权重。Llama、Gemma 这类模型,你可以下载使用,但用于生成这些模型的代码和数据,也就是俗称的“配方”并未公开。AI前线
第二层是开放配方。BLOOM、Pythia、OLMo、LLM360 更进一步,开放了训练数据、代码、日志或中间检查点;2022 年 BigScience 训练 BLOOM 时,就已经公开过 TensorBoard 日志和故障处理过程。
第三层,是 Marin 正在做的开放过程:每个实验先在 GitHub Issue 里声明目标和假设,配置以代码和 PR 提交,外部研究者可以参与 Review,实验启动后训练指标实时公开,而且所有成功、失败和中途修改的痕迹都保留。小红书上有人总结得很直白:Marin 来自 Percy Liang 团队,放出 18.75T token 训练全程(含翻车记录)。小红书
这个立场很快得到了声援。Percy Liang 的帖子在 X 上浏览量突破 80 万,吴恩达将Marin称为当前捍卫AI开放性的一次“珍贵示范”,强调该项目不仅开放模型代码,还公开数据、训练配方和实验过程。AI前线
这场“直播”值多少钱
值得算一笔账。11 套 GB200 NVL72 约合 792 颗 Blackwell GPU,连续训练约 90 天,总卡时大约 171 万卡时。按海外 Blackwell 级算力公开租价的常见区间(每卡时约 3 至 6 美元)粗算,仅算力成本就在 500 万到 1000 万美元量级,这还不包括电力、运维和研发人力。这只是基于公开信息的粗略估算,但足以解释围观热度为什么高——正如知乎作者转述的,真正令人震撼的是,大家现在居然可以通过 WandB 平台,实时观看一个价值数十亿美元规模的大模型训练过程如何一步步成长。知乎
围观渠道有三个:W&B 上的实时训练曲线面板(含缩放梯对照),GitHub 项目 issue 区(本次主训练 Issue 编号 8435,数据配比、训练配置、工程问题都会持续更新),以及官方公布的数据构成页面。

未来 100 天,建议盯这四个点
如果打算持续跟进,我建议别泛泛刷动态,Marin 公开材料里已经给出了四条值得长期盯的信号。
信号一:主训练 loss 是否贴着“缩放梯”预测走。正式开跑前,Marin 先训练了一组从 1.6B 到 27.7B 的四级缩放梯,用来拟合损失、计算量和模型规模的关系。Marin表示,这套缩放实验只占最终计算量的约1%,但能够承担几项关键任务。首先,它可以预测535B模型在不同训练阶段应达到的损失水平。如果主训练曲线明显偏离预测值,团队就能较早判断数据、路由或优化器是否出现问题,而不必等到几万亿Token之后才发现训练失效。AI前线围观期只看一条曲线,就看这条。

围观是真能学到东西的。网友 James Thewlis 一直实时跟进曲线,发现第 500 step 附近 norms(参数范数)出现一个峰值,后来自己搞明白并分享:这个峰值完全是由 router_bias(路由偏置) 导致的。它并不是通过梯度训练得到的参数,而是 MoE(混合专家模型)中用于 token 平衡机制(token balancing heuristic) 的一部分。知乎这种知识,过去只能靠进实验室亲手踩坑才能换到。
信号二:Token Dropping 比例。MoE 训练会把不同 Token 路由给不同专家,一旦某些专家过载,超过容量上限的 Token 会被直接丢弃。Marin团队披露,之前的实验中,当上下文长度从4K扩展到65K时,TokenDropping比例曾从约7%上升至约40%。AI前线所以这次先用 4K 上下文启动,靠新的专家并行方案把比例压到约 3%,再逐步向长上下文扩展——届时比例是否再度抬头,是 Marin 自己也承认的实验性风险。
信号三和四:数值稳定性和预案触发。Marin 在缩放实验里发现,训练周期拉长后梯度范数一度增长到4以上,若不处理,训练可能在中途完全发散,团队为此引入了 logit z-loss。AI前线同时,项目明确预留了针对硬件故障、算力利用率下降和进度延误的应对方案:如果问题出现在前 25% 的 Token 预算内,可能缩减最终训练量并重排进度。后续如果官方突然修改计划,先对照这份预案再下结论,不必直接解读成“翻车”。
这场直播值得谁花时间
说点实际的:
预训练/中训练从业者:重点看数据配比和中期训练的切换方式,这是过去花钱都买不到的 500B 级完整样本。小红书上已经有博主把它当成预训练工程师的学习素材,直言这比只开源权重的大模型多了原始数据集、数据配比、训练代码、Infra代码、实验日志。小红书
Infra/系统工程师:重点看 JAX 在 GB200 上的专家并行、All-to-All 通信和 Token Dropping 治理,这部分工程价值不亚于模型本身。
技术决策者和投资者:把它当成一次“开放 vs 封闭”的路线样本来观察,看社区和厂商如何跟进表态。
每周只有 5 分钟的人:每周看一次 W&B 曲线,只盯上面四个信号,不必全程追更。
也泼一点冷水:535B 是 MoE 总参数,不等于 535B 稠密模型;预训练 loss 不代表最终能力;项目仍在训练早期,公开本身不能代替评测。现在急着下“能不能打”的结论,还太早。
写在最后
Marin 不是第一个直播大模型训练的实验室,但它正在进行的,可能是目前模型规模和研发透明度结合得最激进的开放训练实验之一。AI前线接下来三个月,最有价值的产出也许不是最终的模型权重,而是这份记录本身:专家如何路由、梯度何时异常、长上下文怎么一步步扩展——无论模型最终成败,这些经验都会成为整个行业的公开资产。感兴趣的话,把四个观察信号存下来,隔几天去曲线面板打个卡,比刷新模型新闻更值得。