这周,在前沿大模型"发布当天才算见面"的行业惯例里,发生了一件罕见的事:由斯坦福大学 Percy Liang 教授领衔的 Marin 开放实验室,正式启动了 Marin 535B-A23B 的完整训练,而且把整个过程对外公开——不是训完了再放模型,而是从第一步训练开始,数据、日志、检查点、甚至失败记录都实时可查。哔哩哔哩截至发文,这件事在中文社区基本没传开:B站只有一条几百播放的介绍视频,微博、知乎几乎没有讨论。但对关注模型训练的人来说,这可能是今年最值得"追更"的事——第一次有机会完整围观一场前沿规模的大模型是怎么练出来的。
先把训练计划摊开看
根据项目方公开信息(B站UP主"鲲鹏Talk"今日整理转述),这次训练的关键参数如下:
项目 | 参数 |
|---|---|
模型 | Marin 535B-A23B,MoE 架构,总参数约5350亿,每token激活约230亿 |
集群 | 11台 GB200 NVL72,每台72张GPU,合计792张 |
数据量 | 18.75万亿 tokens |
总算力 | 约 2.7e24 FLOPs |
周期 | 约3个月:80%预训练 + 20%中期训练,之后做后训练 |
两个参照系帮你理解这个规模:2.7e24 FLOPs 和 DeepSeek-V3 技术报告披露的总训练算力是同一量级;而535B-A23B的命名是 MoE 模型的典型写法——总参数5350亿,但每次推理只激活230亿,这意味着它训成之后,推理成本更接近一个20B级的稠密模型,而不是一个500B级的巨兽。这也是 MoE 如今成为开源阵营主流选择的原因。

稀罕的不是"开源模型",是"开源过程"
现在开权重的模型不少,但 Marin 做的是另一件事:开放开发(Open Development)。权重、数据组成、架构决策、实验记录全部公开之外,这次训练还有几个此前几乎看不到的动作:
第一,正式开训前,他们先跑了从1.6B到27.7B的4级缩放阶梯(scaling ladder),用小模型调试并预测535B的最终损失。哔哩哔哩这等于先把"预言"公布出来,再用三个月的真实训练当众验证——scaling law 在这个规模上到底准不准,第一次有了公开的对照实验。

第二,WandB 实时看板对所有人开放,损失曲线、吞吐量、集群状态都能看;训练日志挂在 GitHub issue(#8435)里,任何人都能在评论区提问。
第三,中间检查点全部公开,并且明确承诺:失败和意外也实时记录。集群训练里宕机、掉卡、loss 尖峰才是常态,这些"事故记录"平时是各家实验室最不外传的东西。

Marin 不是临时起意。这个团队从2024年起就坚持全流程开放,用 JAX 构建,之前发布的开源模型在多项基准上超过 Llama 3.1 8B 和 OLMo 2 32B(项目方口径)。哔哩哔哩微博
怎么围观:入口和四个值得盯的信号
按项目方公开的信息,围观入口有四个:官网 marin.community、GitHub 仓库的 #8435 号训练日志 issue、WandB 实时看板,以及 Percy Liang 本人的社交账号。哔哩哔哩
如果只能盯四件事,我建议是:
预测损失兑现度。前两周最值得看的,是实际 loss 曲线和缩放阶梯预测之间的偏差。偏得大,说明现有 scaling law 在500B级 MoE 上的外推不靠谱,这对所有做训练规划的人都是直接参考。
有效算力和中断频率。792张 GB200 连跑三个月,中断是必然的。看他们多久存一次 checkpoint、中断后怎么恢复、MFU(有效算力利用率)能稳在多少——这比任何论文都直白。
数据配比调整。20%的算力留给中期训练,什么时候换数据、换什么数据,项目方承诺公开配方。这正好回应了最近知乎上吵得很热的话题——“大模型微调缺少高质量数据怎么办”,看看前沿团队怎么处理数据质量和数量的权衡。知乎
最终开源范围。训练结束后的后训练和发布阶段,权重、数据、代码到底开到什么程度,决定了这次实验对社区的实际价值。
对你自己的训练,能带走什么
即使你不碰前沿训练,这场直播也有三样现成的作业可以抄:
一是缩放阶梯的做法。先用小3到4个数量级的模型把超参和 loss 走势摸一遍,再上大集群,是控制试错成本的标准姿势——自己微调时同样可以先在0.5B、1.5B上验证配方,再动大模型。
二是监控指标的选择。这周 Krea2 团队在分享训练基建时也提到同样的观点:别看表面的 GPU 利用率,要看 TensorCore 实际利用率、跨节点通信和高速互联指标。哔哩哔哩Marin 的公开看板正好是个现成的指标样板。

三是 checkpoint 和失败复盘的纪律。中小规模训练里"训到一半崩了重来"的成本同样肉疼,公开日志里怎么处理静默错误、怎么定保存频率,值得逐条看。
留三个问题,接着追
最后说清楚边界:目前这件事的中文一手信源仍然很少,训练刚启动,最终模型能不能打、会不会成为开源第一梯队,谁说了都不算,项目方此前的基准成绩也只来自他们自己的口径。下面三个问题,等训练推进才有答案:
缩放阶梯预测的最终损失,三个月后兑现了吗?
792张卡全程跑下来,真实的有效算力利用率和中断率是多少?
后训练结束后,开放的权重和中间检查点能换来多少社区复现?
这条线我会持续关注,有节点性进展(loss 曲线公布、首次中断复盘、中期训练切换、最终发布)再来更新。