千问全模态模型发布当天:音频降98%是真的,但三个数字最容易混——接进产线前先对完这张账

源自216位全网作者

06:37

9月18日,阿里千问正式上线原生全模态模型Qwen3.8-Omni-Flash:文本、图像、音频、视频四类输入,1M上下文,千问AI平台和阿里云百炼当天可调用。最扎眼的一行是"音频输入每小时降超98%"。但把官方口径和流传截图对一遍,几个数字已经各说各话。先别急着申请Key,把这张账对完。微博

千问全模态模型发布当天:音频降98%是真的,但三个数字最容易混——接进产线前先对完这张账

降价:98%和93%是两行,对象是上一代Plus

官方口径:每小时音频输入价格降幅超98%,每小时音视频同时输入降幅超93%。按官方价格折算,纯音频每小时从约1.3元压到两分钱以下,音视频从约16元压到1元上下。两条线对应两种输入形态,不能混成"全模态降九成八"。知乎

对照物:基准是上一代Qwen3.5-Omni-Plus,这代是Flash档——"Flash价格拿长音视频"才是降价的真实含义。另外,"一小时"并非本代首次:上一代已支持3小时音频,更早同名Flash上限才150秒;这次变化是长音视频落到低价档。知乎

评测:官方自报的成绩单,哪几项值得抄

官方口径是"累计30项评测、平均提升超26%"(渠道流传的"29项25%"是口径漂移,以官方博客为准)。分项里值得多看几眼的:WildClawBench-MM 71.0,上一代34.5,同表Gemini 3.8 Flash为58.9;AgenticVBench提升22.3分;多说话人会议AliMeeting的DER/cpWER从88.11/89.61降到3.35/17.18,接近从"不可用"到"能用"的量级。整体定位:音视频接近Gemini 3.8 Flash,音频整体超过。知乎知乎

最值得抄进自己方案的是Agentic理解这笔账:模型先低分辨率扫全片,再对关键片段拉高精读,OmniVideoBench准确率63.4提到67.8,单次查询Token从145,736降到79,117,省约46%——长视频"全帧抽满"的计费逻辑开始松动。注意:发布刚过一天,以上全部为官方自报,第三方复现还没落地。知乎

三个最容易混的口径:主语都是别人家的

第一,这个模型只输出文本。百炼文档写得很清楚,要语音合成得换Qwen3.5-Omni或Realtime产品线,"语音进语音出"别记在它头上。第二,首音频包0.98秒、RTF约0.153(约6.5倍实时)以及口语陪练、“听声辨位"这些演示,主语都是姊妹模型Qwen3.8-Omni-Flash-Realtime。第三,这次开源的是Qwen-MM-Plugins(含Video2Note、Omni Skill Creator)和Qwen-Live Harness运行环境,模型权重暂未放出——上一代Qwen3-Omni-Flash就是"只给API不放权重”,被开源社区记了一笔;权重放不放,看HF和魔搭即可。知乎知乎

交付:把整条流水线交给它之前,先跑一张验收单

千问全模态模型发布当天:音频降98%是真的,但三个数字最容易混——接进产线前先对完这张账

官方最激进的演示是把尺度说清楚了:让Qwen3.8-Omni-Flash当研发Agent去改进小模型的四川话识别,12小时四轮实验、构建3413条数据,字符错误率从25.79%降到15.30%——好看,但15.30%仍要人工校对,能复现的是"数据-实验-回退"这套循环,不是免检的成品。知乎

谁现在值得试点:一小时内的会议纪要与待办(说话人切分+转录+身份对应是原生卖点)、长视频转图文笔记、录屏转可复用Skill,以及所有曾按"素材太长、输入太贵"否掉的需求,值得重新算账。谁建议再等:拿官方跑分当采购依据的(等第三方实测)、等开源权重的、做实时语音产品的(端到端延迟要自己量)。验收动作就一条:拿一段你真实的1小时素材,跑一遍新链路,记下输入费用、工具调用次数、人工返工时长和通过率,再和旧流水线对比——跑分回答"值不值得测",这组对照才回答"值不值得换"。

输入成本的地板被打穿之后,"用不用得起"不再是第一否决项;“用不用得好”,得靠你自己的素材说了算。

精选参考来源

1
全模态感知,从理解到交付今天,新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线。模型支持文本、图像、音频和视频输入及 1M 长上下文,能够自主规划任务、调用工具并完成创作。在延续编程、文本处理和 GUI 操作之外,模型进一步拓展了音视频 Agentic能力,无论是视频剪辑、MV 创作,还是影视解说、音视频转图文摘要等,都能游刃有余。👍长音视频理解:找得准、理解深、执行快能面对数小时长视频,模型能从问题出发,决定该看什么、听什么,通过多轮取证定位关键信息;结合工具,可从会议中提炼纪要、待办与风险,并继续发邮件、写代码,或检索多模态资料生成深研报告。 ✌️音视频创作:从理解素材到交付成片创作音乐视频时,模型能理解歌曲结构、节奏和情绪,为镜头设计提供灵感,并输出带时间戳的句级歌词; 短剧翻译中,它能一气呵成完成角色识别、口语化翻译、克隆配音、音轨重混与成片质检;面对长电影,还能完成情节提炼、解说规划、配音配乐、剪辑渲染与最终质检。📝信息沉淀:把视频变成可复用资产模型能完成信息提炼、结构重组与结果校验,将长视频中的核心知识与实践经验转化为信息密度更高、更易获取和复用的内容资产。如,自动梳理视频知识、拆解步骤,生成图文对应的 PDF 笔记,甚至将其转化为经过校验和评测的 Agent Skill。🎧实时交互:边感知,边响应Qwen3.8-Omni-Flash-Realtime 可在音视频流输入的同时完成感知与响应,结合实时上下文调用工具、执行任务,适用于口语陪练、空间音频感知和智能客服等场景。🔧两套开源工具,连接工作流我们进一步扩展了 Qwen-MM-Plugins,新增多项面向音视频理解与创作的能力,支撑内容创作、视频转笔记、视频转技能等工作流;同时开源了Qwen-Live Harness,实现持续、实时的音视频交互与任务执行。Qwen3.8-Omni-Flash能力更强,价格更低。在累计 30 项评测上,相比上一代 Qwen3.5-Omni-Plus,平均得分提升超过26%。同时,API 每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。模型现已上线千问 AI 平台,欢迎体验并反馈!#千问大模型##Qwen##AI##
2
Qwen3.8-Omni-Flash:从理解到交付,释放全模态Agent生产力
全部
来源
内容由AI生成

精选参考来源

1. 全模态感知,从理解到交付今天,新一代原生全模态模型 Qwen3.8-Omni-Flash 正式上线。模型支持文本、图像、音频和视频输入及 1M 长上下文,能够自主规划任务、调用工具并完成创作。在延续编程、文本处理和 GUI 操作之外,模型进一步拓展了音视频 Agentic能力,无论是视频剪辑、MV 创作,还是影视解说、音视频转图文摘要等,都能游刃有余。👍长音视频理解:找得准、理解深、执行快能面对数小时长视频,模型能从问题出发,决定该看什么、听什么,通过多轮取证定位关键信息;结合工具,可从会议中提炼纪要、待办与风险,并继续发邮件、写代码,或检索多模态资料生成深研报告。 ✌️音视频创作:从理解素材到交付成片创作音乐视频时,模型能理解歌曲结构、节奏和情绪,为镜头设计提供灵感,并输出带时间戳的句级歌词; 短剧翻译中,它能一气呵成完成角色识别、口语化翻译、克隆配音、音轨重混与成片质检;面对长电影,还能完成情节提炼、解说规划、配音配乐、剪辑渲染与最终质检。📝信息沉淀:把视频变成可复用资产模型能完成信息提炼、结构重组与结果校验,将长视频中的核心知识与实践经验转化为信息密度更高、更易获取和复用的内容资产。如,自动梳理视频知识、拆解步骤,生成图文对应的 PDF 笔记,甚至将其转化为经过校验和评测的 Agent Skill。🎧实时交互:边感知,边响应Qwen3.8-Omni-Flash-Realtime 可在音视频流输入的同时完成感知与响应,结合实时上下文调用工具、执行任务,适用于口语陪练、空间音频感知和智能客服等场景。🔧两套开源工具,连接工作流我们进一步扩展了 Qwen-MM-Plugins,新增多项面向音视频理解与创作的能力,支撑内容创作、视频转笔记、视频转技能等工作流;同时开源了Qwen-Live Harness,实现持续、实时的音视频交互与任务执行。Qwen3.8-Omni-Flash能力更强,价格更低。在累计 30 项评测上,相比上一代 Qwen3.5-Omni-Plus,平均得分提升超过26%。同时,API 每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。模型现已上线千问 AI 平台,欢迎体验并反馈!#千问大模型##Qwen##AI##

2. Qwen3.8-Omni-Flash:从理解到交付,释放全模态Agent生产力

3. 降价超93%,Qwen3.8-Omni-Flash能进生产线吗?

4. 音频输入降价 98%:千问 Qwen3.8-Omni-Flash 想让音视频智能体「干完活」

5. 【#阿里发布Qwen3.8OmniFlash全模态模型#:音视频能力提升,百万 Token 图文音视频输入 0.8 元】该模型可同时处理多模态输入,支持 1M 上下文,全模态能力较上一代大幅提升,音视频能力接近 Gemini 3.8 Flash,API 价格降幅超九成,还推出多项新功能。#阿里千问##大模型

6. Qwen3.8-Omni-Flash 主打音视频智能体交付通义千问正式发布新一代原生全模态模型 Qwen3.8-Omni-Flash,同步推出实时交互版本及两款开源工具套件,核心推动全模态能力从 “内容理解” 向 “端到端任务交付” 升级。模型原生支持文本、图像、音频、视频四类输入,搭载 1M token 上下文窗口。29 项综合评测显示,平均分较上代 Qwen3.5-Omni-Plus 提升超 25%;成本端优化显著,音频输入每小时 API 价格降幅超 98%,音视频联合输入价格下降超 93%。音视频智能体专项基准中,WildClawBench-MM、AgenticVBench 分别提升 36.5、22.3 分,整体音频表现超越 Gemini 3.8 Flash,音视频综合能力跻身行业第一梯队。核心突破在于智能体式音视频理解机制。传统方案需全量读取音视频内容,算力消耗高。Qwen3.8-Omni-Flash 可基于用户问题自主筛选关键片段,通过由粗到细的多轮证据检索定位信息,无需逐帧处理。测试显示,该模式下 token 消耗降低 45.7%,同时识别准确率不降反升。落地场景覆盖音视频生产全链路:音乐 MV 创作可解析歌曲结构并输出分镜方案;短剧翻译可一站式完成说话人识别、字幕翻译与配音混音;长电影解说可自动提取剧情、生成脚本并调配音轨;会议场景可联合音视频区分发言人,输出纪要与待办事项,还可联动工具派发任务。此外模型还能自主迭代小模型,或从视频中萃取结构化知识与标准化 SOP。实时版本主打低延迟连续音视频交互,支持 WebSocket、WebRTC 接入,具备空间音频定位能力,可结合视觉完成空间导航,支持动态注入业务知识与角色设定,适配实时客服、口语教学等场景。配套同步开源 Qwen-MM-Plugins 插件套件与 Qwen-Live Harness 运行框架,兼容主流智能体框架;API 兼容 OpenAI 协议,支持三档推理强度调节,方便开发者按需权衡成本与效果。整体来看,本次发布将音视频从感知输入升级为智能体执行任务的原生媒介,成本大幅下降加速工程化落地,但复杂长叙事内容的一致性控制仍待持续打磨。#Qwen##全模态大模型##音视频智能体##AIAgent##前沿在线#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章