792块GPU连跑100天,535B大模型训练全程直播:真正值钱的是这笔成本账和4个数

源自24位全网作者

00:26

"太疯狂了——现在你甚至可以直播围观一个535B大模型是如何被训练出来的。“过去几天,这条在X上传开的帖子,对应的是一件真事:开放基础模型项目Marin已于上周启动Marin535B-A23B的训练,并且整个训练过程将全程公开进行。知乎消息很快获得吴恩达转发,他将Marin称为当前捍卫AI开放性的一次"珍贵示范”,强调该项目不仅开放模型代码,还公开数据、训练配方和实验过程。36氪

对每天追国产开源模型、对比API价格、顺手本地跑两把的人来说,这条热搜真正的问号不是"535B有多大",而是:这场直播值不值得蹲一百天,能带走什么。这篇一次讲清:直播规模、这趟账多少钱、哪些数字能带走、哪些说法要防。

这场直播到底多大:792块GPU跑100天

  • 算力和数据:按照目前公布的计划,Marin535B-A23B将处理18.75万亿Token,其中约80%用于预训练,20%用于中期训练;训练运行在11套NVIDIAGB200NVL72系统上,预计持续约3个月。36氪

  • 硬件折算:团队准备了总计18.75万亿token的训练数据,部署了11套GB200NVL72系统,约合792颗GB200GPU。知乎

  • "535B"的真实含义:它不是让全部5350亿参数同时工作,而是先由路由模块判断输入内容,再把Token分配给一部分专家网络。

  • 不是一新手:截至目前,Marin已经训练过8B和32B模型,并开始将实验规模扩大到535B-A23B MoE模型。

现在,这个主模型已经正式开始运行,所有人都可以直接查看实时训练曲线——数据配方、配置、失败记录都在GitHub issue和W&B里实时更新。

这趟直播多少钱:网友喊"数十亿美元",和现货价差着一个数量级

即便训练模型本身已经很庞大,真正令人震撼的是,大家现在居然可以通过WandB平台,实时观看一个价值数十亿美元规模的大模型训练过程如何一步步成长?知乎情绪是真的,但把账按公开行情算一遍,会发现这场直播和"数十亿美元级"的闭源实验室投入之间,隔着差不多两个数量级。

买断口径:市场上流传的行情是"400万美元一台的GB200机柜",11台整柜硬件就是约4400万美元,还没算电费、运维和折旧。知乎

租卡口径:我们看到的B200小时租赁价从6.11美元跌到4.22美元,这是现货价格——散客、中小企业随用随租的零售市场。知乎照792卡、每天24小时、连跑90天算约170万GPU时:按现货4.22美元约720万美元,按一个月前的6.11美元约1040万美元——量级在"千万人民币到七千万人民币",不是"十亿"。

提前声明:这是估算不是官方数字,折旧、电力、网络是否计入都会改变绝对值;但在这个区间内取任何值,都不影响一个判断——训练一个535B级MoE,已经不是一笔只有巨头付得起的钱。这跟你每天刷到的价格战是同一件事:Qwen3.8-Flash已经做到每百万Tokens输入1元,输出3元,相比空闲时段的DeepSeek-V4-Flash输入价格低33.33%,国产开源模型的API价格还在往下打。36氪“参数竞赛"和"价格战”,是同一条成本曲线上的两个果。

直播间里比"535B"更值得带走的4个数字

  • 有效利用率中位数只有13.6%:参考档d2048的成绩:计算步~24Mtoken/s(MFUp50~13.6%),持续~17Mtoken/s。知乎翻译成人话:几百块顶级GPU的大部分时间不是在算,是在把Token搬去对应的专家那儿——MoE的瓶颈从来是通信不是算力,这也解释了为什么各家把"原生长上下文"当卖点。

  • Token丢弃率7%→40%:之前的实验中,当上下文长度从4K扩展到65K时,TokenDropping比例曾从约7%上升至约40%。36氪Marin靠手写并行方案在4K下把丢弃压回3%,团队自己承认再拉长还会恶化——"百万上下文"的工程账,是在直播间里明着付的。

  • 训练数据是切出来的不是攒出来的:原始池25.6Ttoken、292个来源;MinHash模糊去重+针对主流benchmark的n-gram去污染,去掉2.494T。"18.75万亿token"是去重去污染后的最终配方,下次再看到"训练数据XX万亿"的宣传,先问砍完剩多少。

  • 1%算力先造保命梯:开训前,花1%算力跑5个宽度的ScalingLadder,提前预注册对最终loss的预测。上一轮就靠它抓到梯度范数随规模增长的问题,补了logit z-loss——消融证明,在高BatchSize等条件下,如果不处理这个问题,训练可能在中途完全发散。小模型先跑航线,是整场直播里最便宜也最通用的避坑经验。

"开源"三个字,先分清三件事

第一,535B不等于535B稠密,激活口径不同、专家结构不同,只比总参数没有意义,要比就同时比训练Token数、专家数量和实际FLOPs。

第二,开源不等于数据随便搬。有人尝试匿名下载项目里宣称公开的Harrier数据存储,收到403,维护者dlwh的回应是:数据混合的元数据可以尽量分享,但原始数据无法直接开放下载。知乎它开的其实是"过程与知识"——配方、代码、决策过程全开,数据卡在授权和托管成本上。

第三,“直播训练"不是第一次。2022年,由HuggingFace牵头的BigScience就在训练1760亿参数模型BLOOM期间公开了TensorBoard日志,并持续披露训练进展、系统故障和解决过程。36氪Marin的增量是把开放从"发布后给一份整理好的技术报告"变成实验室的默认工作方式:假设提前声明、配置走PR接受审查、失败照写。顺带一个细节:GitHub上的项目标题目前写作"535B-A23Bon18Ttokens”,对外公告却用18.75T口径——官方自己的口径都还没对齐,转发"实锤数字"之前建议多留个心眼。

谁该蹲这场直播,蹲什么

  • 纯围观:就当看一次"顶级AI实验室内部原本紧闭的暗室突然被打开"。知乎但别期待三个月后它直接坐进SOTA牌桌:预训练损失只说明拟合程度,代码、数学、Agent能力还要过后训练,公开不能代替评测。

  • 考虑本地部署的:社区里已有观点认为,消费级本地部署大模型进入了一个新的阶段,虽然还是很贵,但真的达到了可用线。知乎但这场直播轮不到你加预算:535B权重远超消费级显存,该等的是它训练完成后的评测和量化版下沉,再决定升不升级。

  • 学训练的:这是免费教材——还给100天的运行列了12项健康检查清单和4个风险节点,失败记录实时写进issue。知乎想系统入门,发起人Percy Liang在斯坦福还有一门理论课:《CS336: Language Models From Scratch》。

接下来三个月看三个信号:主训练loss是否偏离缩放梯的预注册预测(偏离才是数据或路由出问题的信号);扩展到65K上下文时TokenDropping会不会反弹;4个风险节点会先兑现哪一个。别急着说它翻车——团队早就写明,如果问题出现在前25%的Token预算内,可能缩短最终的Token训练量,改配方是预案不是事故。至于结局,现阶段的判断恐怕是:这场实验现阶段最重要的产出,可能还不是三个月后的模型权重,而是它沿途留下的训练记录。36氪跑成了,开源社区拿到一份大规模MoE训练的全套日志;跑砸了,公开的失败路径一样是研究样本。这场直播真正被追问的问题只有一个:谁有权知道模型究竟是怎样被训练出来的——你蹲的这100天,就是答案的一部分。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章