这几天关注 Qwen 的人,信息流大概率被 Qwen3.8 系列刷屏了。但在同一周,阿里还上线了一个对"动嘴派"更重要的东西:Qwen-Audio-3.0 系列语音模型,8月17日正式登上千问AI平台和阿里云百炼平台。微博
官方口径相当高调:在全球权威AI评测平台 Artificial Analysis 今年7月的语音排行榜上,Qwen-Audio-3.0 拿下语音识别(ASR)、语音合成(TTS)、实时交互(Realtime)三个赛道的全球第一,被官方称为"大满贯"。知乎微博上更出圈的解读是:实时交互这一项,超过了 OpenAI 的 GPT-Realtime-2。微博
先把丑话说在前面:榜单是7月的评测,"大满贯"是官方引用口径,而且社区对它的真实延迟、中文方言表现、嘈杂环境下的识别率,实测目前基本还是空白。但这不妨碍它值得上手——因为这次的核心升级,正好打在过去几年语音AI最让人难受的两个点上。

从"对讲机"到"打电话",差在哪
过去的语音助手,绝大多数是"对讲机模式":你说一句,等它识别完、想完、念完,你才能再说下一句;你想插话,它还会自顾自把话说完。
原因不复杂。传统方案是三段式拼接:ASR 把语音转成文字 → 大模型处理 → TTS 再念出来。三段串行,天然做不到边听边说,打断更是无从谈起,延迟也是一段一段叠出来的。
Qwen-Audio-3.0-Realtime 走的是端到端路线:语音直接进、语音直接出,模型原生支持边听边说、随时打断追问,还支持工具调用——也就是一边跟你说话,一边能帮你查信息、执行任务。知乎语音交互从"下指令"往"打电话"靠拢了一大步。知乎上已经有开发者用它做了个叫 LiveSeek(寻声)的开源语音Agent,按作者自己的说法,“边听边说、随时打断都是模型原生支持的,不用自己拼ASR、TTS那一堆东西”。知乎
另外注意,这次不是一个模型,而是三件套,对应三种不同需求:
Qwen-Audio-3.0-ASR:语音转文字,主打复杂语境和专业领域识别;
Qwen-Audio-3.0-TTS:文字转语音,多语种、多方言,还能控制情绪、语气和节奏;
Qwen-Audio-3.0-Realtime:端到端实时对话,是这次的绝对主角。知乎
只想做转写或者配音,单独调前两个就行;想要"打电话"的感觉,得上 Realtime。
三条上手路线,按身份挑
路线一:普通用户,打开千问App白嫖。
官方确认这套模型已经在千问App、千问办公、Qoder 等产品里应用。知乎小红书不花一分钱,先去App里感受下"边听边说、随时打断"到底是什么手感,再决定要不要深入。这一步没有任何成本,建议所有人都先做。

路线二:开发者,百炼API按量付费,或订阅 Token Plan。
限时优惠价格值得单独拎出来:个人版 Lite 39元/月(每7天2500 Credits)、Standard 139元/月(4倍Lite用量)、Pro 499元/月(16倍Lite用量)。知乎注意 Token Plan 不是语音专属——千问AI平台近期上的 Qwen3.8-Max、Qwen-image 3.0 pro、Wan3.0,甚至第三方的 Kimi K3,都在同一个 Credits 池子里。如果你本来就在用千问的文本模型,加个语音能力不用多开一份订阅,这是它相对单独的语音API划算的地方。
路线三:Agent玩家,盯紧开源的 Qwen-Audio-Agent。
这是阿里7月底开源的一个实时语音框架,定位很有意思:它不做App,专门给你现有的Agent(OpenCode、Codex 这类编程助手)加上"耳朵和嘴巴",让你用打电话的方式指挥AI干活——你边说边想,它边听边干。微博B站上已经有安装教程,收藏量上百。哔哩哔哩对想给自己的工作流加语音入口的人来说,这可能是三件套里可玩性最高的一个。

三盆冷水,也是三份待观察清单
强判断先不下,这三个问题目前都没有答案,建议先放进观察列表:
真实延迟未知。 端到端延迟目前没有任何可信的公开实测,"打电话级"的体验到底打不打折,要等社区上手测。
中文方言和噪声待验证。 多方言、情绪语气控制都是官方口径,真实场景(方言、口音、地铁公交噪声)表现还没有第三方数据。
会不会开源权重。 Qwen 家的音频模型是有开源传统的:Qwen-Audio、Qwen2-Audio 都开放过权重,但这次3.0目前只有API和平台调用。微博微博对本地部署党来说,开不开源是最大变量,值得蹲一个后续。
一句话总结:Qwen-Audio-3.0 把语音AI的竞争方向说得很明白了——不再卷"听得准",而是卷"能打断、边听边说、还能干活"。榜单第一的先别全信,等实测;但如果你受够了语音助手的"对讲机感",现在就可以打开千问App,用嘴跟它聊几句试试。