9月23日深夜,你的信息流大概率被同一只鸟刷屏了:骑单车的鹈鹕——这个把多模态圈折腾了半年的基准,被Claude Opus 5.5宣布"终结"。 新智元的标题更猛:大语言模型,正式开始吞噬多模态。36氪
刚好这两周把视觉API接进流水线的同学,心是悬着的。有人前脚刚把DeepSeek的"眼睛"测完接进识图链路,有人刚对完Omni-Flash的音频账单,还有人Seedance、GPT Image的生图流程跑得正热。现在一句"吞噬多模态",好像把上个月的全部选型判了死刑。
先别急着拆流水线。我把官方公告、知乎实测、B站测评和评论区翻了个遍,这场发布里其实藏着四本账,而且越对越细。
第一本账:降价40%和打8折,是两个价
官方口径:Opus 5.5多数任务达到Fable 5.1的水平,任务成本比Opus 5低约40%,输出速度快30%,默认100万token上下文,自适应思考全程在线。36氪
但"降40%“是降价吗?看API牌价:输入4美元、输出20美元每百万token——相比上一代Opus 5只是打8折,缓存读取降幅更明显,社区标题干脆写的就是"API价格打8折”。那40%是端到端任务成本:一部分是效率省出来的,不是牌价让出来的。同一批实测里,Fable 5.1的牌价是10/50美元,所以这句才成立:Opus 5.5用2.5倍便宜的单价,打平2.5倍贵的性能。知乎
旁边的对照锚点也别忘了:9月22日GPT-6 Sol/Luna发布,API牌价直接较上一代腰斩50%。 程序员鱼皮首发实测里,Sol全程速度压着Opus 5.5打。所以这轮"吞噬"最先吞噬的是Fable那一档的定价空间——你那些按"分"计费的专用API,还没进它的射程。36氪知乎
第二本账:是便宜,但它更费token
四组跨平台的实测数字放一起才看得清:
鱼皮跑5个真实案例,Opus 5.5一口气花掉600多块,还是API价。知乎
B站UP主"喵了个猫了个咪了个猫"用同一套150分考卷横评:Opus 5.5拿143.16分,GPT-6 Astra 125.96分,GPT-6 Sol 101.24分——但Opus 5.5的输出token高达72.9万,是另外两家的4倍;按"每美元换多少分"折算,Sol约是三家的3倍。哔哩哔哩
Opus 5.5领先Astra的17.2分里,有14.2分来自网页和3D——也就是说,它最值钱的能力恰好是"写代码画画面"那部分;
t3.gg的Theo提醒更实在:Max思考档位下单线程跑了6个半小时没进展,切回High十分钟做完。 档位选择,是这代模型账单的一半。哔哩哔哩
结论很直白:按站内这两周对过的识图账单——专用视觉API一千张图几块钱的量级——换成Opus 5.5这种"72.9万token干活风格",同样的活儿成本要抬两三个数量级。刚接好的识图流水线,没有拆的理由。
第三本账:"吞噬多模态"到底吞的是什么
把刷屏的这一波演示拆开看:1:1复刻阿波罗8号的"地出"照片、用JavaScript画整座小镇的动画、自画像基准、Python渲染的5秒黑洞科普片,还有那支被转疯的30秒视频——实测的人原话是"它一帧都没生成"。 连那条5秒黑洞科普片的出处,也是同一批代码渲染演示。知乎36氪
这些画面的共同点:没有一帧来自扩散模型。它不是"学会画了",是学会了写渲染代码——canvas、three.js、Python逐帧出图。 所以能力边界其实特别清楚:36氪
吞得掉的:所有"可编码的视觉活儿"——UI原型、动效、科普动画、3D场景、数据可视化。社区叫它"重回宝座的前端之王";B站kate的10个视频实验(三蹦子广告、兵马俑跳街舞、谍战片买鸡蛋)全程只用Medium档。哔哩哔哩
吞不掉的:照片级图像、真人实拍、画质竞赛那条线——GPT Image、Seedance、Qwen-Image这些生成管线一根汗毛都不用动;
官方基本没提的:视觉输入。这次发布主打长文本、Agent和画布交互,识图、视频理解的基准没怎么单独宣传——那恰好是Qwen-Omni-Flash、DeepSeek视觉线这些专用模型躺着的战场。
所以"大语言模型吞噬多模态"的真实版本是:过去需要三四个模型接力完成的中间层工序——先生成图、再排版合成、再转成动画——现在被一段代码吞了。吞的是工序,不是两端。
第四本账:风险账,评论区比评测诚实
兴奋期过后的第二天,评论区集中出现三类追问:
封号。“唯一的缺点就是封号”“教我怎么让Claude账号活过2天”——国内用户走API和订阅的可用性,是这台模型最大的隐性成本;有传言称封禁还在扩大,没有实锤,但把订阅当长期基建之前,这个风险你得计价。
成色。“只展示结果不展示工具和提示词,纯粹是耍流氓”——大量刷屏演示不可复现;知乎Karminski直接怀疑Opus 5.5是Fable 5.1的蒸馏量化版,官方没有回应。可以怀疑先存档,但跑分登顶的话术也请等第三方复测。知乎
作弊。Git源宝三家盲测声称抓到有模型"偷偷作弊"。 首发测评的水并不清,重大切换决策请等一周后的独立基准。哔哩哔哩
谁该动、谁不该动
看图、批量识别、音视频转写的产线:不动。专用API的成本位差它够不着;
做网页、动效、讲解视频、设计原型的:可以立刻试,但Medium起步,别碰Max;
已经在跑"小模型读图→结果喂大模型"两段式的:值得做一次A/B——把截图、图纸连同任务直接丢给Opus 5.5单发,对一下端到端token成本。图文+长文档联动的复杂活(设计规范、财报、界面+代码库),100万上下文的单发模式确实省掉中间转手;纯批量识图的,省下来的转手费不够付token钱。
接下来盯什么
9月24日谷歌确认Gemini 4已进入后训练,官方说法是比原定年底"早得多"。 叙事是世界模型架构+原生多模态——如果这条线为真,真正威胁专用多模态API的是下一波,不是Opus 5.5这一波。另外两个信号:阿里Qwen-Audio-3.1同日官宣全线降价70%-95%,专用模态的价格战还在加深,护城河反而更清楚;以及,盯住Opus 5.5视觉输入的第三方基准什么时候出——"吞噬多模态"这句话成不成立,全在那张没发的表上。哔哩哔哩
一句话收尾:Opus 5.5这轮吞掉的是中间层工序,你那头识别、这头生成的流水线两端它都没碰。对完40%和8折这两把尺、对完token账,再决定要不要动你的流水线——而大概率你会发现,最该动的只有做动效和原型的那部分人。