国产大模型开源卷到新阶段了:这次放出来的不是成品,而是训练的“半成品”。
8月20日,蚂蚁百灵开源了Ling-3.0-tiny-base和Ling-3.0-flash-base两个基座模型。注意关键词“base”——没有对齐、没有指令微调、不能直接聊天的那种。更少见的是,他们还把训练过程中的6个检查点一起放了出来:预训练完成、中期训练完成、WSM合并完成,三个阶段各一个,两款模型加起来一共6个。知乎

对关注AI训练的人来说,这件事值得多看两眼。
别人开源成品菜,这次把“后厨”也打开了
按开源圈的惯例,放出来的通常是后训练完成的模型,也就是SFT加对齐之后的版本。你拿它能微调、能部署,但底层的训练数据配比、训练路线都被锁死了。
Base模型是另一个概念:它是所有后训练之前的“地基”,拿它做什么训练、喂什么数据、怎么对齐,全由你自己决定。这也是为什么在Ling-3.0-tiny的Hugging Face社区页面上,有开发者直接留言问“Can we get a base model?”。知乎相比一个更好的聊天模型,预算有限的研究者更需要一张能自己画画的白纸。有人提了,百灵真给了,这个互动本身挺说明社区需求的。
更值得说的是中间检查点。以往就算开源base,放出的也是最终结果,训练过程是黑盒。这次把“预训练完成、中期训练完成、WSM合并完成”三个中间态也交了出来,用处大致有三类:
第一,研究观察。模型能力在每个阶段怎么变、中期训练到底加了什么、WSM合并带来多少增益,这些过去只能靠论文里的曲线猜,现在能自己跑对照实验了。
第二,自选起点。做继续预训练或领域适配时,不同目标适合不同起点。想自己安排中期训练数据配比的,可以从更早的检查点接手。
第三,也是最实在的:省试错成本。tiny和flash两款模型用的是同一套训练方案,官方明确建议先在tiny-base上低成本验证训练策略,跑通了再放大到flash-base。对算力预算有限的团队,这是一条少烧钱的路径。
两个底座,各适合谁
先说参数:
Ling-3.0-tiny-base:总参数7.9B,激活参数只有1.3B(稀疏MoE架构)。官方给的方向是代码领域继续预训练和SFT、预算敏感的强化学习rollout、高校教学、MoE消融实验。
Ling-3.0-flash-base:总参数124B,激活参数5.1B。定位是大型代码库、专业推理、长流程Agent的训练底座,以及金融、医疗、科研、工业等领域的继续预训练。
一个MoE的常识提醒:稀疏激活意味着算力开销看激活参数,显存和存储开销看总参数。1.3B激活让每一步的前反向计算很轻,但训练时7.9B的完整参数和优化器状态仍要装进显存,别把“激活1.3B”误读成“随便一张卡随便训”。不过在LoRA这类参数高效微调场景下,它的门槛确实远低于同总参的稠密模型。

官方口径里,tiny-base用约前代一半的总参数在多数评测上取得更高成绩,代码能力突出;flash-base面对总参数2到3倍的base模型仍有竞争力。知乎注意,这些是官方自己的评测,第三方实测还没跟上来。

三句降温的话
Base不能聊天。官方自己都写明了:base模型没做指令对齐,不建议未经后训练就部署成聊天服务,更不建议没做额外对齐就用于安全关键场景。知乎只想要个能聊的模型,去下instruct版本,别碰base。
榜单不等于好用。官方也承认,benchmark只代表特定设置下的能力,不等于聊天体验和Agent效果。拿它当训练底座的参考可以,当成品保证就算了。
中间检查点对多数人不是刚需。做领域微调的工程师,其实下载最终那个WSM合并后的base就够用;中间检查点主要便宜的是研究训练过程、改训练管线的人,不用跟风全量下载。
为什么这一波值得盯着
把最近一周的国产开源动作串起来看更有意思:Kimi K3全量开源后,千问、DeepSeek持续跟进,据央视网援引行业数据,中国研发的开源模型下载量已占全球总量的41%。知乎DeepSeek还在上演“一边开源一边涨价”。36氪竞争方向明显在变:从比谁先发模型,到比谁开放得更深——开源base是把训练的起点交出来,开源检查点,差不多是把训练过程也交出来了。
接下来值得盯三个信号:这些底座上能不能长出有分量的衍生模型,尤其是RL后训练和领域代码方向;第三方实测成绩和官方口径是否对得上;会不会有更多厂商跟进开放中间检查点。如果几个月后社区拿这6个检查点没做出什么像样的东西,那这波开源的象征意义就要大于实际价值了。