Qwen3.8-Omni-Flash发布当天:四个降价数字、一张没发推的表,音视频活儿先分三档再决定要不要换流水线

源自32位全网作者

06:36

9月18日,阿里正式发布原生全模态模型 Qwen3.8-Omni-Flash:文本、图像、音频、视频四种输入一次打通,1M 长上下文,API 同步上线千问 AI 平台和阿里云百炼。官方给的价格口径相当激进:每小时音频输入价格降幅超过98%,每小时音视频输入降幅超过93%。图文音视频输入百万 token 低至 0.8 元。微博知乎知乎

如果你是多模态模型的长期关注者,这一天你大概已经在各个 AI 日报里刷到过"白菜价""卷疯"这类词。但如果你是要把会议纪要、短剧翻译、视频解说这些真实工作流往这个模型上迁的开发者,先别急着看热搜。这篇把官方发布口径、博主逐段核对过官方博客的验证视频、第三方验收文和全网的头一天实测摊开,算清三件事:降价到底降的是什么,跑分表讲没讲全,首日实测的裂缝能不能用。

一、98%和93%是真的,但降幅数字不止四个

先看这轮最抢眼的三组数:能力涨 25%、音频输入降 98%、音视频输入降 93%。注意口径:它们都是相对上一代 Qwen3.5-Omni-Plus 的比值,而且只覆盖输入侧。第三方评测文做过换算——如果上一代处理同一段素材的输入调用成本记 100 元,按 93% 降幅这一代约 7 元;但插件、生成、存储、人工复核都还得另算。知乎

更细的坑在降幅本身。有 B 站博主用浏览器逐段读取了阿里官方发布博客,发现同一次发布里"降幅"出现了 93%、98%、89%、51.8% 四个版本,口径差异全部写在脚注里;文本价格的单位在中文正文标 CNY、英文价格图标 USD,差了 6.7 倍。无独有偶,官方发布文里写的是"累计 30 项评测平均得分提升超过 26%“,而当天大部分二手传播用的是"29 项平均提升 25%”——发布仅数小时,连"平均提升"的统计范围都在漂移。对账之前,先认准明细表。哔哩哔哩知乎

真正值得拆开看的是第四笔账。模型先用低分辨率扫全片,从问题出发定位关键片段(官方演示里锁定了 0:42:54 至 0:43:00 这 6 秒,再拉高分辨率读出制服上的身份牌),把算力集中在真正相关的片段上。官方给出的 Agentic Understanding 数据同样印证这个机制:OmniVideoBench 上准确率从 63.4 提到 67.8,单次查询 Token 消耗从 145,736 降到 79,117,降幅约 45.7%。换句话说:省钱的不是模型变便宜,是它学会了"少看"。这对账单的含义很直接——"每小时降 93%“不能直接换算成"我的任务降 93%”,实际省多少,取决于你的素材里答案是不是真的只占那几个片段。知乎知乎

Qwen3.8-Omni-Flash发布当天:四个降价数字、一张没发推的表,音视频活儿先分三档再决定要不要换流水线

二、官方推文说"接近",博客里还有一张没发推的表

官方的原始措辞相当克制:“音视频能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash”。传播时这句被写成了"碾压"。逐项拆开看差别在哪:音频确实是碾压局——AliMeeting 会议转写的 DER 从 88.11 降到 3.35,多人重叠说话是会议场景最难啃的硬骨头;但视频侧逐项对齐后,有四小项输给 Gemini 3.8 Flash。知乎

最有意思的是官方博客深处那张推文只字未提的表:在同样的 Agent 模式对比里,把 Gemini 接上 Qwen Code,它的分数反而涨了 4.9 分,绝对分比 Qwen3.8-Omni-Flash 更高。那位逐段核对的博主顺手 clone 了官方开源的 Qwen-MM-Plugins(Apache-2.0,约 5572 行代码)验证:所谓 Agent 能力,实为 9 个 MCP 检索工具加一张预建的图。这张表对开发者的含义比任何单项跑分都重要——增益主要来自编排层的话,模型就是可替换件,你真正攒下的资产是工具链和工作流。至于官方给出的 WildClawBench-MM 71.0(同表 Gemini 3.8 Flash 为 58.9、上一代 34.5),博客没公布满分、任务量和复现条件,第三方评测文的建议是:适合初筛,不适合直接写进采购结论。哔哩哔哩知乎

Qwen3.8-Omni-Flash发布当天:四个降价数字、一张没发推的表,音视频活儿先分三档再决定要不要换流水线

三、首日实测:能打的和翻车的都在这

官方数字等第三方复现的同时,全网头一天的实测拼图已经能看出边界。B 站博主"AI产品狙击手"的全模态首日实测结果比较典型:能打的——音频转录整体优秀只有个别错别字,能找出图形细微差异,远距离方位和模糊行车视频的时间点判断大体准确;翻车的——一段视频里鸳鸯的雌雄计数颠倒,剧照第一次认错电影、换成截图才识别正确,复刻接星星游戏画面"形似"但缺了键盘操控逻辑。精确计数和身份锚定,发布首日仍然会翻车,"数得对不对、认得准不准"这类硬需求别直接上生产。哔哩哔哩

还有两处最容易混的口径。第一,输出只有文本——百炼文档写明 qwen3.8-omni-flash 接收文本、图片、音频、视频,输出文本;要语音输出得走 Qwen3.5-Omni 或 Realtime 产品线。“口语陪练”“听声辨位”(官方称首个支持该能力的全模态大模型)、首音频包约 0.98 秒、RTF 约 0.153,这些卖点的主语都是姊妹模型 Qwen3.8-Omni-Flash-Realtime,别记在主体模型头上。第二,"支持一小时音视频"并非本代首创——上一代 Qwen3.5-Omni 已支持 3 小时音频或 1 小时视频,这一版的实质变化是长音视频落到了 Flash 档位、并配上了新的执行链路。另外别忘了有第三方提醒:发布仅数小时,基准明细、开源范围、新价格表都还没摊开,目前所有数字都出自官方自报——这次开源的是 Qwen-MM-Plugins 和 Qwen-Live Harness 两个工具仓库,模型本身并未开源。知乎知乎知乎

最完整的演示其实藏在"大模型研发小模型"的实验里:Agent 自主选定评测集、连续 4 轮构建 3413 条数据,把 Qwen2.5-Omni-3B 的四川话识别字错率从 25.79% 降到 15.30%。但 15.30% 意味着平均六个字仍错一个,到不了免复核程度;这套循环能否迁移到其他方言和任务,目前没有第二个案例。知乎

Qwen3.8-Omni-Flash发布当天:四个降价数字、一张没发推的表,音视频活儿先分三档再决定要不要换流水线

四、要接入,先把活儿分成三档

把上面的账合并成一张决策表:

第一档·现在就接:音频为主、文本输出的任务。会议纪要、素材打标、音视频转图文摘要。AliMeeting、LongAudioSpan 的提升口径明确,输入侧账单显著下降,试错成本就是多跑一遍转录,风险最低。

第二档·进试生产:视频理解工作流。短剧翻译、影视解说、视频转笔记。第三方评测文给的验收协议值得直接抄:选一段你自己的真实一小时素材,定一个有明确交付标准的任务,同时记录输入费用、工具调用次数、人工修改时长、失败回退和最终通过率,再用旧流水线跑同一份素材——“官方跑分回答值得不值得测,这组对照才回答值不值得换”。逐项检查三件事:模型会不会选证据片段、选了之后调用量是不是真的降了、漏看关键片段有没有回退机制。知乎

第三档·等价目表:实时交互与语音输出。主语是 Realtime API,等第三方端到端延迟实测和它的价格表,别拿主体模型的 93% 做实时业务预算。

持续观察三个信号:基准明细与新价格表的公开时间(目前全部官方自报)、"视频侧输四项"和"Gemini 接工具链涨 4.9 分"能否被第三方复现、首日实测里"鸳鸯计数"这类硬伤一周内有没有修复案例。

这轮全模态竞赛,把考题从"看得见听得懂"换成了"能不能交付"。98%、93% 这些数字里,真正值得你亲自算一遍的只有一行:用你自己的素材,跑一张一小时的验收账单——那才是这次发布里唯一可以直接写进财务预期的数字。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章