这一周的多模态圈,三件事几乎撞在了同一条时间线上。9月18日,阿里的新一代原生全模态模型Qwen3.8-Omni-Flash上线,官方给出的价格数字相当吓人——每小时音频输入降价超过98%,每小时音视频输入降价超过93%。 9月23日,谷歌DeepMind负责人确认旗舰模型Gemini 4已进入后训练阶段,即将发布。 9月24日,一个叫SpaceBunny的神秘免费模型突然出现在OpenRouter和OpenCode上,1M上下文、多模态、零数据保留,看着像天降羊毛——结果第二天就被知乎用户三道题测到"拉完了"。知乎微博知乎
如果你正在为音视频转写、会议纪要、视频转图文这类活儿按token付费,这七天正好卡在"降价"和"等新"之间。这篇就把官方数字、社区实测和免费羊毛一次说清,帮你看完再做决定。
一、官方的三组数字,先分清哪些能直接信
官方博客里最抢眼的三组数字:29项评测平均提升超过25%、每小时音视频输入价格降幅超过93%、每小时音频输入价格降幅超过98%。注意,这三组的对照基准都是上一代Qwen3.5-Omni-Plus,而且全部来自官方口径,目前还没有第三方复现。知乎
跑分方面,音视频Agent方向的WildClawBench-MM,官方成绩71.0,同表格里Gemini 3.8 Flash是58.9,上一代只有34.5。官方的说法也比较克制:音视频能力"接近"Gemini 3.8 Flash,音频能力"整体超过"。 知乎上做生产线分析的观点很中肯:71.0适合做初筛参考,不适合直接写进采购结论——官方没给满分、任务量和复现条件。知乎

二、成本账到底怎么算:100块变7块,但只算了输入侧
这是这次发布对普通人最有感的部分。按93%的降幅换算:上一代处理同一段素材要花100块的输入调用成本,这一代大约只要7块。 一小时发布会素材,过去"抽帧、分轨、跑ASR、对齐时间轴、脚本拼回去"的流水线,现在可以重新评估"整段丢进去,直接要三条短视频"的方案。知乎

但有三个前提要记住:
第一,这个换算只覆盖输入侧。 输出、工具调用、插件生成、存储、人工复核,一个都没算进去。省的是"素材太长用不起"这条否决理由,不是整条生产线的账单。
第二,真正省钱的思路是"先扫再精读"。 官方给了一个很实用的数据:长视频理解走Agentic模式,模型先用低分辨率扫全片定位关键片段,再拉高分辨率精读,OmniVideoBench准确率从63.4提到67.8的同时,每次查询的token消耗从145,736降到79,117,降幅约45.7%。 对你的账单来说,这比降价百分比更实在——它意味着同样的活儿,token用量直接少近一半。知乎
第三,评论区有人发现,它的价格和Qwen3.8-Flash标得一样。 B站实测视频下有用户对比后发出疑问"文本方面应该就是同一个模型吧",但这只是社区观察,官方没有确认,别当结论用。
三、B站实测一周后的真实口碑
播放最高的全模态测评(超5500播放)给了一份挺有参考价值的清单。能做到的:找出图形细微差异、远距离方位判断、模糊行车视频里判断时间点大体准确、音频转录整体优秀只有个别错别字。翻车的:鸳鸯雌雄计数直接颠倒;剧照识别第一次认错电影,换一张截图才认对;复刻"接星星"游戏画面可以但缺键盘操控。哔哩哔哩
评论区比视频本身还有信息量。有人直接问"能用来批改试卷吗",up主回复"应该可以"——注意这是"应该",不是"亲测"。也有人指出认电影这类测试不联网就是纯蒙,希望补测幻觉、时间戳准确性、上下文深度写作这些硬指标。还有懂行的观众点名希望测官方宣传的重点:纯音频分辨不同说话人、听音乐判断情绪、空间音频听声辨位(这代支持立体声了)。目前这些方向的独立实测还基本空白。
另一条两千多播放的实测更有工程味:up主拿Qwen3.8-Omni-Flash和Gemini 3.8 Flash跑同样的真实任务,对比好用程度和实际花费,完整测试代码和文档开源在了GitHub上。 想自己复现的,照着跑一遍比自己瞎试快得多。哔哩哔哩
四、切换之前,这三个坑先看清
坑一:型号混淆,这是最容易踩的。 Qwen3.8-Omni-Flash和Qwen3.8-Flash不是一个东西,后者是文本侧的;Omni-Flash的API输出只有文本,想要语音输出得换Qwen3.5-Omni或者Realtime产品线。 听声辨位、口语陪练、实时交互这些能力属于Qwen3.8-Omni-Flash-Realtime,又是另一个模型。评论区已经有人把下一代Qwen 4的期待错放了——有用户指出"4是大语言+视觉,没有音视频输入支持"。 你要是音视频处理,就不存在"等Qwen 4更好"这回事,Omni是独立产品线。知乎哔哩哔哩

坑二:1小时长音视频不是这一代首创。 上一代Qwen3.5-Omni系列已经支持3小时音频或1小时视频。 这次的真正意义是:长音视频能力落到了Flash这个低价档位,同时配上了新的执行链路。别被"支持1小时"的说法带着走,那是上一代就有的。知乎
坑三:不开源。 评论区一句"这些多模态模型都不开源"道出了本地部署党的现实——想在自己显卡上跑全模态,目前还是得用旧的Qwen3-Omni-30B-A3B或者Qwen2.5-Omni-3B。这次的新能力,只能在云上按量付费。
五、那只免费的兔子,能薅但别当生产力
SpaceBunny这波羊毛来得快,翻车也快。上线当天,知乎上的主流猜测是MiniMax家的M3.1——有用户对比了text tokenizer和Vision tokenizer,基本匹配。 但体验结论普遍不乐观:速度和表现都更像Flash档位,甚至不如V4.1 Flash,大概和GLM 5.3 Flash一个水平。知乎

第二天更狠的实测来了。有博主出了三道几百上千字提示词的题:一道品牌官网、两道3D体素场景。结果官网题勉强及格(但基本是把提示词抄成了网页);两道3D题一道楼群内部大片黑窗、一座体素城整块悬空,点名要的昼夜循环从头到尾没演示出来。三道题打分6、4、2,总分4,博主的原话是"水平跟豆包在一个档次"。知乎
结论很简单:免费、1M上下文、零数据保留,当玩具薅一周没问题;但正事别交给它,省下的token钱会以返工时间的形式还回去。
六、那到底切还是等?
谷歌那边,DeepMind负责人9月23日确认Gemini 4处于后训练阶段初期,官方口径是世界模型架构、原生融合感知与多模态理解、百万级上下文,计划先推早期版本再持续迭代。 微博上已经有人喊"gemini4快点上线,3.8顶不住了"。但注意两点:Gemini 4初期版本先出、要持续迭代,尝鲜和稳定生产是两回事;而且它是闭源订阅制,跟Omni-Flash这种按量付费的API降价不在一个账本上。微博
我的建议按人群拆开:
音视频重度用户(自媒体、会议纪要、字幕转写):现在就值得试。输入侧成本松动是实打实的,一条真实的一小时素材丢进去,和旧流水线各跑一遍,账单对比最有说服力。
开发者:走OpenAI兼容协议就能接入现有工程。别一次性把整条流水线交出去,先复现一条窄链路——比如"视频转图文"或"角色分离后的翻译"——跑通模型、插件、质检和失败回退,再决定要不要换。
白嫖党:SpaceBunny当免费玩具,SpaceBunny别当生产力。
等等党:可以等Gemini 4,但Omni线的降价不等Gemini 4,两件事不冲突。真正该盯的信号是:第三方批量实测什么时候覆盖说话人分离和听声辨位、Qwen 4发布时Omni线会不会再调价。
最后提醒一句:官方跑分回答的是"值不值得测",你自己素材上的完成率、返工时长和总成本,才回答"值不值得换"。降价潮里最贵的,是把演示当能力的那个决定。