535B“直播炼丹”没有摄像头:先拆掉这3个误读,再按三档跟法看完这场100天公开课

源自182位全网作者

06:47

8 月 18 日,一个编号 8435 的 GitHub issue 在 marin-community/marin 仓库下被创建,标题很朴素:[Hero Run] 535B-A23B on 18T tokens。知乎发起人是斯坦福 CRFM 主任、TogetherAI 联合创始人 Percy Liang:他准备了总计 18.75 万亿 token 的训练数据,部署 11 套 GB200 NVL72、约合 792 颗 GB200 GPU,计划连续训练约 3 个月,总计算量约 2.7×10²⁴ FLOPs,之后还有后训练阶段。36氪没有直播间,没有弹幕,loss 曲线、数据配方、代码提交、甚至失败实验全部实时公开。

这条宣布帖在 X 上的浏览量突破 80 万,吴恩达很快转发,称它是当前捍卫 AI 开放性的一次"珍贵示范"。36氪

535B“直播炼丹”没有摄像头:先拆掉这3个误读,再按三档跟法看完这场100天公开课

对刚把鱼书翻完、跟着小土堆或李沐跑通过单卡玩具训练的人来说,这可能是第一次不用隔着技术报告想象"真实的 frontier 训练长什么样"。但越是这种时候越容易白看:社区这几天热转的同时,也混进了几个明显的误读。先把误读拆掉,再谈怎么跟、谁能跟出东西。

先把三个误读拆掉

误读一:"直播"就是有个摄像头在炼丹。 Marin 的"直播"没有摄像头。它公开的是一条训练证据链:每个实验先用 issue 声明假设,配置以代码 PR 提交,外部研究者可以 review,开跑后 W&B 训练指标实时公开,失败和中途修改也照写——这套"开放实验室"机制本身就写在发起公告里。36氪围观方式是"读",不是"看"——这决定了你该花什么成本跟:盯 issue 和设计文档有用,天天刷 loss 曲线截图发动态基本没用。

535B“直播炼丹”没有摄像头:先拆掉这3个误读,再按三档跟法看完这场100天公开课

误读二:535B 就是又一个 GPT-4 级巨兽。 它是 MoE(混合专家)模型:5350 亿是总参数,每个 token 实际参与计算的激活参数约 230 亿,架构里 384 个专家每层只激活 8 个,外加 2 个常开的共享专家。36氪用 6ND 粗算,2.7×10²⁴ FLOPs 公开口径下大约是 Llama 3.1 405B 稠密训练算力的十分之一量级——它是"前沿规模",但不是"最强算力堆料"。比较 MoE 时只盯总参数或只盯激活参数都会翻车:专家数、路由方式、共享专家比例、训练 token 数都得一起看。

535B“直播炼丹”没有摄像头:先拆掉这3个误读,再按三档跟法看完这场100天公开课

误读三:"全开源"等于数据和权重随便用。 有人匿名去下载它宣称公开的 Harrier 数据,吃了个 403;维护者回应:数据混合的元数据尽量分享,原始数据无法直接开放下载。知乎Marin 真正开的是过程与知识——配方、代码、决策记录、监控曲线——而不是给你一个能直接接着训的免费语料库。做项目选数据集的人,别把它当免费数据写进方案里。

顺带一个事实校准:这不是"全球首次直播训练大模型"。2022 年,由 HuggingFace 牵头的 BigScience 在训练 1760 亿参数的 BLOOM 期间就公开了 TensorBoard 日志,并持续披露训练进展、系统故障和解决过程。36氪此后 Pythia、LLM360、AI2 的 OLMo 系列陆续开放数据、代码、日志和中间检查点。Marin 的增量不在"公开过什么",而在把公开做成实验室的默认工作方式:不等训完再整理发布,而是从假设到失败实时摊开。认清这点,你对它的期待才会落在正确的位置。

五个只在"真训练"里才学得到的数字

如果你只打算从这场 100 天的公开课里带走东西,下面这五个细节比 loss 曲线本身值钱,因为它们全是教程不会写的部分。

1. 花 1% 算力买一张"故障检测图"。 Marin 没有直接把算力梭进 535B,而是先训了一组从 1.6B 到 27.7B 的缩放梯(scaling ladder),只占最终计算量约 1%,用途是预注册"535B 的 loss 应该长什么样",主曲线一旦明显偏离就能在早期定位数据、路由还是优化器出了问题。36氪上一轮缩放实验就抓到过梯度范数随规模涨到 4 以上的隐患,催生了 logit z-loss 这个修复——消融显示没有它,大 batch 条件下训练会中途爆掉。知乎缩放律在这里不是炫技公式,是故障检测系统。

535B“直播炼丹”没有摄像头:先拆掉这3个误读,再按三档跟法看完这场100天公开课

2. token dropping:7% → 40% → 3%。 MoE 训练里一个教科书几乎不提的坑:上下文长度从 4K 拉到 65K,token 批次里独立序列变少、专家负载失衡,被容量上限丢弃的 token 比例从约 7% 飙到约 40%。36氪Marin 的应对是先退回 4K 上下文启动预训练,再用手写的 pooled-wave 专家并行把 4K 下的丢弃率压到约 3%(容量因子 1.15),2 个全宽共享专家作为"骨架"兜底,团队观测到 40% drop 下学习曲线仍无 loss spike。知乎纸上画路由是算法题,把路由训稳是系统工程题。

3. MFU 只有约 13.6%。 按其公开参考档(d2048)口径:计算步约 24M token/s、持续约 17M token/s,MFU p50 约 13.6%——也就是说,一整个机房的 GB200,有效算力只用出了约七分之一。知乎"训练大模型=堆卡"的直觉在这里碎得最彻底:瓶颈在跨卡通信、专家负载、显存访问。他们甚至因为在 JAX 生态里没找到够快的现成专家并行方案,自己写了一套 EP,OOM 证据都原样贴在技术报告里。

4. 超参不是手调的。 矩阵参数用 MuonH、lm_head 用 AdamH、小参数用普通 Adam,学习率等关键超参不是拍出来的,而是从自家 scaling law 用算力预算标定的闭式公式直接算出来。知乎入门课里"learning_rate=1e-4"那种调法,在这个规模下根本不存在——调参的经验直觉,大部分只在 toy 尺度成立。

5. 敢公开风险预案。 100 天的运行列了 12 项健康检查清单和 4 个风险节点。知乎团队提前写好了撤退方案:如果问题出现在前 25% 的 token 预算内,就缩短最终训练量、重新调整学习率衰减和数据配比,而不是机械地维持原计划。36氪技术报告你年年能看到,"提前写好的撤退方案"这种透明度,才是开放实验室机制里最稀缺的部分。

三种人,三档跟法

研一新生 / 自学入门: 不建议裸读 issue。社区已经有人在做拆解:知乎上"Marin 开源大模型训练"系列已经更到第 3 篇(共 6 篇),384 选 8 路由、LatentMoE、半 RoPE + 每 4 层一个 NoPE 全局层这些架构决策都拆到了代码行号。知乎B 站也有 CS336 实操风格的解读视频可以配着看。哔哩哔哩每周 1 小时、一篇一篇过就够,目标不是学会训 535B,而是把"训练=数据进去 loss 出来"的脑补图,换成一张真实世界的大模型训练工序图。

做 MoE / 训练系统方向的研究生和工程师: 直接读 #8435 的规格总评论和 EP 技术报告。重点看"架构选择与系统预算联合设计"这个思路——把 token 分发前先压到 3072 维 latent 空间再走专家,全 to 全通信量直接减半;有评论问 GB200 NVLink 带宽这么高为什么还要压,作者的回答值得细读。你训不动 535B,但 drop 率、均衡偏置、梯度范数监控这套决策记录,换个尺寸照样用。

只吃热点、或明年要面试的: 不用天天盯,等三个里程碑就行——中期训练曲线是否兑现缩放梯的预测、是否触发过风险节点、后训练权重和技术报告是否按承诺开放。最终报告出来再精读一遍,成本半小时。

继续观察这四个信号

  1. 口径还没统一:GitHub issue 标题写 18T token,对外公告是 18.75T。以后引用数字,以最终报告为准,现在谁拿精确值背书谁就是在抄作业抄错行。

  2. 现在谈能力为时过早:预训练 loss 只说明对数据分布的拟合,代码、数学、长上下文和 agent 能力取决于中训和后训练。社区如果很快开始吹"开源新王",先确认有没有第三方评测,没有就等。

  3. 训练中途是高危窗口:前 25% token 预算是团队自己都预告过的调整窗口,这两周 issue 更新密度会最高;跑稳之后可以把跟频降到每周一次,没必要日更式刷帖。

  4. 看它会不会食言:数据不开放可以理解,但如果最终 checkpoint 和技术报告也缩水,那这场实验最重要的产出就从"样本"变成了"教训"——这两种结果对社区都有价值,前提是它继续如实记录。

过去几年,开源模型解决的是"谁可以使用模型";Marin 想接着回答的是"谁有权知道模型究竟是怎样被训练出来的"。对租不起 GPU 卡的大多数深度学习学习者来说,这个问题的答案不在三个月后的权重里,而在你现在愿不愿意用正确的方式,把这 100 天免费的过程看完。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章