「多模态变便区」刷屏秋招圈:把8月的发布列表数完,死的是部门编制,不是这项能力

源自167位全网作者

08-29 05:43

小红书上一条《坚守多模态还是转Agentic RL》,攒下了379个赞、126条评论、402次收藏。评论区排最上面的一条很扎心:「我就做多模态的,能跑就跑。」小红书

再往前翻几天,《多模态的困境》《多模态还是好方向吗》《多模态今年秋招怎么投》接连冒出来,凑在一起就一句话:一年前还香的多模态,怎么突然成「便区」了?小红书 hc骤降、大厂撤方向、后训练的岗「体感少了很多」——这些是27届、28届算法学生和从业者的原话。小红书

恐慌是真恐慌。但你把8月基模公司的发布列表数一遍,会发现另一个事实:多模态一个都没缺席,反而每家都在往上押。

一边是「跑路」,一边是满屏发布

先数事实,全部是8月内发生的:

  • 8月21日,DeepSeek V4-Flash「长眼」上线,能直接看图,1000张图1块钱。36氪

  • 8月27日,36氪实锤神秘「牛来」模型就是智谱,GLM首个原生多模态,还跑在国产卡上。36氪

  • 同一天前后,阿里Qwen3.8-Flash-Next开源,125B总参数的多模态MoE、只激活6B。哔哩哔哩

  • 更早的8月3日,MiniMax发多模态模型H3:性能强、便宜、还开源。36氪 三周后,它交出上市后首份半年报:上半年收入1.166亿美元、同比增长283.1%。知乎

  • 8月28日,也就是今天,微信视觉团队全开源WeMM-Embedding家族:2B在MMEB-v2拿下77.9分、越级干掉此前所有8B开源模型,9B以80.6分登顶总榜第一,把商业闭源模型也一起超了知乎 注意最后一句简介——它已经在视频号、公众号、朋友圈、搜一搜里完成14次线上A/B测试并大规模部署。知乎

「多模态变便区」刷屏秋招圈:把8月的发布列表数完,死的是部门编制,不是这项能力

一个「已经黄了」的方向,不会同时是五家公司的当季主打。矛盾在哪?

死掉的是「独立多模态赛道」这个组织形态

把社区恐慌和公司动作拼起来看,真相没那么戏剧化:撤退的是编制,不是能力。

最典型的是腾讯混元。7月,大语言模型部和多模态模型部被撤销合并成「基础模型部」,统一归姚顺雨。36氪 随后原多模态理解负责人胡瀚离职创业,负责HunyuanVideo/HunyuanImage的钟钊在朋友圈预告自己快发的是「最终版本」,xAI出来的蔺旭东接手内容生成。

表面看是多模态团队连环地震,实质是那条「语言一条线、多模态一条线」的双轨制没了——多模态被并进基模主线,汇报线没了,独立方向没了,于是HC和岗位名跟着消失。

所以你在秋招JD里搜不到「多模态」三个字很正常:人还在干这事,但编制标签换成了「基模」「Agentic」「具身」「世界模型」。《多模态的困境》评论区里就有人反问:具身的所有算法都离不开多模态呀,为什么说岗位少?小红书 岗位不是消失了,是改名了。

那为什么业务侧确实觉得「推不动」?

这是内容里最容易被情绪掩盖的另一半。有评论说多模态「有几个问题太难解决,很难落地到业务」,这不是错觉,是三笔实打实的成本账。小红书

  1. 训练侧有「对齐税」。 商汤首席科学家林达华今天接受36氪专访时算过这笔账:给语言模型加视觉,难的不是推理多那点算力,而是数据配比——数据配比不只是把1:9调成2:8那么简单,每次模型升级配比都可能重来。对模型公司来说,问题未必是付不起钱,而是「多做一轮实验,模型就可能比竞争对手慢一个月」。36氪

  2. RL反馈信号是开放问题。 代码有测试用例、数学有标准答案,视觉任务的高质量奖励信号至今没人给出通用解法。这是Coding先跑通商业闭环、多模态慢一步的根本原因——那场专访里还引了一组公开数字:截至7月底,Anthropic的年化收入已超过650亿美元,约为2025年底的7倍。 钱和人跟着闭环走,不跟着愿景走。

  3. 单模态任务ROI算不平,但「基础设施化」算得平。 WeMM-Embedding恰恰是示范:不讲故事,直接进搜一搜和推荐,向量从2048维砍到256维,图像与视频大项还能保住满维度98.7%的性能,省下的推理成本是真金白银。知乎 多模态在业务侧的正确姿势,正在从「做一个能聊图片的模型」变成「把视觉塞进你已有的检索和推荐链路」。

「多模态变便区」刷屏秋招圈:把8月的发布列表数完,死的是部门编制,不是这项能力

不同位置的人,怎么办

  • 27届秋招在即的: 评论区那句「如果你是27届,那已经来不及了」虽然刻薄,但接近事实。小红书 现在转Agentic RL是去抢bar已经「高到天上」的赛道。更实际的路径是保住多模态项目主线,把技能叙事改成「多模态+agent/数据/后训练」,JD没有这三个字不等于面试不要这个人。

  • 28届及以后的学生: 别追标签追到下一个热点。评论区那句反常识的话值得抄下来:「等一个方向所有人都看到是最火的时候,bar已经高到天上去了,不如深耕一个静待花开。」 但要挑对标的——押「理解+行动」结合的场景(视频、空间、GUI),别押纯caption刷榜。

  • 业务侧算法: 退订「多模态是未来」的PPT叙事,对照WeMM的落地公式找自己场景:任意模态→统一向量→挂进现有检索/推荐/风控链路→用A/B说话。

  • 纯研究向: 把林达华「多模态的涌现时刻会在一两年内到来」当赌注,而不是结论。36氪 同一场采访里,梁文锋的「多模态是组件」论并没有被驳倒,两家路线之争悬而未决,这正是个人选择的空间。

接下来盯什么

判断「编制撤退还是能力进攻」,看三个先行信号:一,混元、智谱下一次旗舰发布是否默认原生多模态,GLM-5.3已经是了;二,WeMM这批评测开源后,多久出现第三方在业务里复现,这决定「embedding化」是不是真趋势;三,明年春招JD里「多模态」和「世界模型/具身」两个词的配比变化。恐慌会说谎,发布列表和JD不会。

「多模态变便区」刷屏秋招圈:把8月的发布列表数完,死的是部门编制,不是这项能力

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章