9月18日,阿里千问正式上线原生全模态模型Qwen3.8-Omni-Flash:文本、图像、音频、视频四类输入,1M上下文,千问AI平台和阿里云百炼当天可调用。最扎眼的一行是"音频输入每小时降超98%"。但把官方口径和流传截图对一遍,几个数字已经各说各话。先别急着申请Key,把这张账对完。微博

降价:98%和93%是两行,对象是上一代Plus
官方口径:每小时音频输入价格降幅超98%,每小时音视频同时输入降幅超93%。按官方价格折算,纯音频每小时从约1.3元压到两分钱以下,音视频从约16元压到1元上下。两条线对应两种输入形态,不能混成"全模态降九成八"。知乎
对照物:基准是上一代Qwen3.5-Omni-Plus,这代是Flash档——"Flash价格拿长音视频"才是降价的真实含义。另外,"一小时"并非本代首次:上一代已支持3小时音频,更早同名Flash上限才150秒;这次变化是长音视频落到低价档。知乎
评测:官方自报的成绩单,哪几项值得抄
官方口径是"累计30项评测、平均提升超26%"(渠道流传的"29项25%"是口径漂移,以官方博客为准)。分项里值得多看几眼的:WildClawBench-MM 71.0,上一代34.5,同表Gemini 3.8 Flash为58.9;AgenticVBench提升22.3分;多说话人会议AliMeeting的DER/cpWER从88.11/89.61降到3.35/17.18,接近从"不可用"到"能用"的量级。整体定位:音视频接近Gemini 3.8 Flash,音频整体超过。知乎知乎
最值得抄进自己方案的是Agentic理解这笔账:模型先低分辨率扫全片,再对关键片段拉高精读,OmniVideoBench准确率63.4提到67.8,单次查询Token从145,736降到79,117,省约46%——长视频"全帧抽满"的计费逻辑开始松动。注意:发布刚过一天,以上全部为官方自报,第三方复现还没落地。知乎
三个最容易混的口径:主语都是别人家的
第一,这个模型只输出文本。百炼文档写得很清楚,要语音合成得换Qwen3.5-Omni或Realtime产品线,"语音进语音出"别记在它头上。第二,首音频包0.98秒、RTF约0.153(约6.5倍实时)以及口语陪练、“听声辨位"这些演示,主语都是姊妹模型Qwen3.8-Omni-Flash-Realtime。第三,这次开源的是Qwen-MM-Plugins(含Video2Note、Omni Skill Creator)和Qwen-Live Harness运行环境,模型权重暂未放出——上一代Qwen3-Omni-Flash就是"只给API不放权重”,被开源社区记了一笔;权重放不放,看HF和魔搭即可。知乎知乎
交付:把整条流水线交给它之前,先跑一张验收单

官方最激进的演示是把尺度说清楚了:让Qwen3.8-Omni-Flash当研发Agent去改进小模型的四川话识别,12小时四轮实验、构建3413条数据,字符错误率从25.79%降到15.30%——好看,但15.30%仍要人工校对,能复现的是"数据-实验-回退"这套循环,不是免检的成品。知乎
谁现在值得试点:一小时内的会议纪要与待办(说话人切分+转录+身份对应是原生卖点)、长视频转图文笔记、录屏转可复用Skill,以及所有曾按"素材太长、输入太贵"否掉的需求,值得重新算账。谁建议再等:拿官方跑分当采购依据的(等第三方实测)、等开源权重的、做实时语音产品的(端到端延迟要自己量)。验收动作就一条:拿一段你真实的1小时素材,跑一遍新链路,记下输入费用、工具调用次数、人工返工时长和通过率,再和旧流水线对比——跑分回答"值不值得测",这组对照才回答"值不值得换"。
输入成本的地板被打穿之后,"用不用得起"不再是第一否决项;“用不用得好”,得靠你自己的素材说了算。