给DeepSeek"装眼"只要后训练,K3却烧了15万亿token——"原生多模态"其实是三码事,换模型前先算三笔账

源自381位全网作者

06:54

过去一个月,只要你在拿大模型干活,“原生多模态"这四个字大概率是被按着头听了一整轮:8月21日DeepSeek的看图模型开源,8月27日智谱发布GLM-5.3-Flash,第一次把"原生多模态"挂进GLM的5系列,还顺手用国产卡跑完了训练;9月2日李飞飞的Atlas直接自称"全球首个多模态世界模型”,物料里"原生"二字也没缺席。往前数,Kimi K3、阿里Qwen3.8-Max、MiniMax H3、美国开源新王Inkling,发布材料里全挂着同一块牌子。36氪

热闹归热闹,社区其实一直绷着两根弦。B站那条《DeepSeek首个视觉模型实测》播放干到10.5万,评论区最高赞直接开吹:“同样的图片,手写体写的非常难看,但是gemini能精准识别出来,原生多模态的优势在此,其他模型碰瓷不了”。哔哩哔哩 可另一边,知乎Atlas问题下的高赞回答毫不客气:“我迄今为止不知道’首个原生多模态世界模型’是何意味”。知乎

同一块招牌,有人当能力代差,有人当营销贴纸。而你可能正面对一个很具体的决定:项目里那套"文本旗舰+看图外挂",要不要迁去"原生"阵营?换,怕交智商税;不换,怕下个月榜单变天。

先给结论:"原生多模态"不是一个从0到1的能力档位,而是三种完全不同的做法,对应三张完全不同的价签。把三笔账算完,这道选择题基本就做完了。

一个词,三种做法三张价签

第一种:早融合预训练——“先天长眼”。K3的路线是把约15万亿图文混合token从预训练第一秒就按固定比例混在一起,视觉编码器MoonViT-V2约4亿参数从零训起,不蹭SigLIP的现成权重,让视觉表示直接进下一token预测目标。代价写在参数表里:总参数2.8万亿、每token激活约1040亿。36氪 Qwen3.8-Max同走"大而全"路线:2.4万亿总参、激活950亿,原生视觉、Coding、Cowork全都要。TML的Inkling干脆把45万亿文本/图像/音频/视频token、100万上下文、Apache 2.0完整权重一次性放出来,还罕见地自曝短板:“Inkling并非当今最强的模型,开源闭源都不是”。36氪

第二种:后训练接入——“软升级装眼”。DeepSeek V4-Flash是样本:总参数284B、激活13B,约为K3的十分之一和八分之一,不动架构、不扩参数,更新集中在后训练,Arena WebDev一度打到1577分,前面只剩K3、Claude Fable 5、GPT-5.6 Sol等少数模型;它的看图能力则单独走了一条实验线,名字里自带Exp。36氪 分水岭在视觉数据进场的时机:K2.5技术报告的消融实验显示,如果训练中后期才加入视觉数据,模型的文本能力会先下降、再逐渐恢复。所以早融合用预训练成本换稳定,后训练路线用实验周期换算力——两者都叫原生,钱花在不同科目上。

第三种:旗舰按兵不动,二线先试。这是知乎那个提问——《为什么大多数国内旗舰模型不做原生多模态?》——的完整背景:DeepSeek、智谱、腾讯混元的最新通用旗舰基座仍以文本输入为主。知乎 智谱干脆把首个原生多模态放进flash档——GLM-5.3-Flash只有320B,官方称能力全面超越753B的GLM-5.2,AA榜单57分与Claude Opus 4.8持平,62T训练token全程跑在国产卡上。36氪 某头部基模研究员的成本判断更直白:“如果想做统一原生多模态模型,付出的资源肯定是1+1大于2”。36氪

给DeepSeek

至于把"原生"当形容词用的第四种场景——世界模型物料——商汤首席科学家林达华自己的判断已经给出参照系:多模态的涌现时刻"会在一两年内到来"。36氪 一个需要"等一两年"的方向,意味着今天市面上还没有公认的成品。复旦邱锡鹏的说法更狠:今天大模型真正欠缺的"不只是多模态,而是Context"。36氪

别急着换:外挂生态在干真活

B站上那条播放近4万的《给DeepSeek V4装上视觉外挂,强行多模态》教程,一套开源方案接进Claude Code就能跑;10.5万播放那条实测的评论区里最有信息量的是一个真实案例:有人让模型在Blender里手搓一个学校,建完它"不放心",自己调用软件里的相机渲染了几张图检查,相机被挡住还会挪机位重新拍。哔哩哔哩 这就是外挂路线能活的底层原因——OpenAI 1月的企业使用报告里,研发岗最常用的三类ChatGPT工具,图片上传仅次于搜索和数据分析排第三:需求是真的,只是不一定要长在旗舰里。36氪

给DeepSeek

外挂的天花板同样清晰。图片先转成文字描述、再交给主模型判断,每一跳都漏信息;一位多模态研究员的比喻很难反驳:"一个LLM是’瞎子’,下游配一个能看清楚的小弟。"而K3那类早融合模型玩的是vision in the loop——写完代码直接看页面截图再决定下一轮怎么改,浏览器平台Puter在测试页里埋了5处视觉偏差,K3对照目标页与运行页截图全部找出、零误报。36氪

给DeepSeek

但注意分工边界:单张发票OCR、截图转代码、商品图写文案,这类任务"瞎子老板+看清小弟"的结构完全够用。知乎上一篇工程向回答给了可操作的门槛——OCR类图片占比超过60%,传统Pipeline足够;只有涉及多步推理和工具链联动,原生多模态或混合路由才是正解。

榜单拆穿真相:短板不在眼睛,在续航

同一组评测里,DeepSeek视觉模型和对面旗舰Opus 4.8在单次工具调用上几乎打平——Toolathlon-Verified 75.9比76.2,差0.3分;可任务一拉长,差距立刻显形:多轮交互式Terminal Bench 2.1是83.9对85.0,需要跨文件结合代码库推理的NL2Repo是57.7对69.7,差了整整12分。知乎

给DeepSeek

那篇回答的总结句值得收藏:“视觉理解的短板不在’识别’,而在’推理’”知乎 把图表趋势讲出来不难,难的是根据趋势推断风险、再触发对应的工具调用——链路越长,两次模型间"翻译"的损耗越是复利式累积。

顺带把使用端的账单也摊开:TokenMix视觉API横评里,同样一千张图,DeepSeek输入成本只有1.15元、谷时不到6毛,对面闭源旗舰是29块,差了25倍。36氪 但"原生"不等于白吃:一张图384个token封顶、单请求600张上限,多图预算照样失控。知乎 工程上压到256 token再裁高分辨率关键区域能省,代价是模型可能漏掉边缘细节——定价页上的便宜,都是按最优配置算出来的。

四步自查:什么情况换、什么情况不换

  1. 盘点场景:统计你业务里图片类型分布——OCR类、图表解析类、界面操作类各占多少;

  2. OCR超60%:维持Pipeline/外挂,别为"原生"付溢价,视觉编码器用轻量开源方案即可;

  3. 长链主导(GUI Agent、多轮工具联动、vision in the loop):上原生前先写token预算模型,再谈能力,别忘了实验版稳定性未必经过充分验证;

  4. 混合场景:做路由+fallback,并为路由失误设验收标准——判断失误会把简单任务误投进高成本链路,路由策略本身就是一个隐藏的成本中心。知乎

给DeepSeek

三种人先别换:只想"看图答题"的(看热闹测试,不等于生产);旗舰Coding还没用稳的(业内共识是"Coding才是上牌桌的门槛");把"全球首个"当采购依据的(先查视觉进场在预训练还是后训练)。

接下来盯这三个信号

  • 智谱旗舰版:首席科学家唐杰6月底在X征集"下一版GLM必须加什么",评论区反复出现的答案就是"视觉"——二线试水何时转正,是国产旗舰路线的第一块多米诺。36氪

  • 混元下一版:7月腾讯把大语言模型部和多模态模型部合并成"基础模型部",姚顺雨的路线明显靠拢梁文锋——把视觉转成token服务上下文和行动,而不是独立做世界模型,GUI Agent链路能不能吃上这版红利,值得盯;

  • 价格线:MiniMax H3靠自研VAE把序列长度省4倍,做到默认2K、每秒0.8元——架构效率的降价传导正从生成线往理解线走,急着上车的,账单可能还会变。36氪

给DeepSeek

写在最后

K3那篇报道里有句话把这个赛道说透了:这场竞争像同时拨动了两个时钟——Coding与Agent的排名几个月甚至几周就变,而模型从语言走向世界,需要更漫长的进化周期。36氪 跟着前一个时钟走,你随时可以换船;押后一个时钟,就别把营销词当能力。

训练时机一笔、链路长度一笔、迁移成本一笔——三笔账算完,"要不要上原生多模态"就不是一道跟风题,而是一道有答题卡的选择题。

内容由AI生成
2
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章