Qwen-Audio-3.0上线,官方引用"三项全球第一":边听边说、随时打断的语音AI,从免费到39元/月三条上手路线

源自9位全网作者

11:11

这几天关注 Qwen 的人,信息流大概率被 Qwen3.8 系列刷屏了。但在同一周,阿里还上线了一个对"动嘴派"更重要的东西:Qwen-Audio-3.0 系列语音模型,8月17日正式登上千问AI平台和阿里云百炼平台。微博

官方口径相当高调:在全球权威AI评测平台 Artificial Analysis 今年7月的语音排行榜上,Qwen-Audio-3.0 拿下语音识别(ASR)、语音合成(TTS)、实时交互(Realtime)三个赛道的全球第一,被官方称为"大满贯"。知乎微博上更出圈的解读是:实时交互这一项,超过了 OpenAI 的 GPT-Realtime-2。微博

先把丑话说在前面:榜单是7月的评测,"大满贯"是官方引用口径,而且社区对它的真实延迟、中文方言表现、嘈杂环境下的识别率,实测目前基本还是空白。但这不妨碍它值得上手——因为这次的核心升级,正好打在过去几年语音AI最让人难受的两个点上。

Qwen-Audio-3.0上线,官方引用

从"对讲机"到"打电话",差在哪

过去的语音助手,绝大多数是"对讲机模式":你说一句,等它识别完、想完、念完,你才能再说下一句;你想插话,它还会自顾自把话说完。

原因不复杂。传统方案是三段式拼接:ASR 把语音转成文字 → 大模型处理 → TTS 再念出来。三段串行,天然做不到边听边说,打断更是无从谈起,延迟也是一段一段叠出来的。

Qwen-Audio-3.0-Realtime 走的是端到端路线:语音直接进、语音直接出,模型原生支持边听边说、随时打断追问,还支持工具调用——也就是一边跟你说话,一边能帮你查信息、执行任务。知乎语音交互从"下指令"往"打电话"靠拢了一大步。知乎上已经有开发者用它做了个叫 LiveSeek(寻声)的开源语音Agent,按作者自己的说法,“边听边说、随时打断都是模型原生支持的,不用自己拼ASR、TTS那一堆东西”。知乎

另外注意,这次不是一个模型,而是三件套,对应三种不同需求:

  • Qwen-Audio-3.0-ASR:语音转文字,主打复杂语境和专业领域识别;

  • Qwen-Audio-3.0-TTS:文字转语音,多语种、多方言,还能控制情绪、语气和节奏;

  • Qwen-Audio-3.0-Realtime:端到端实时对话,是这次的绝对主角。知乎

只想做转写或者配音,单独调前两个就行;想要"打电话"的感觉,得上 Realtime。

三条上手路线,按身份挑

路线一:普通用户,打开千问App白嫖。
官方确认这套模型已经在千问App、千问办公、Qoder 等产品里应用。知乎小红书不花一分钱,先去App里感受下"边听边说、随时打断"到底是什么手感,再决定要不要深入。这一步没有任何成本,建议所有人都先做。

Qwen-Audio-3.0上线,官方引用

路线二:开发者,百炼API按量付费,或订阅 Token Plan。
限时优惠价格值得单独拎出来:个人版 Lite 39元/月(每7天2500 Credits)、Standard 139元/月(4倍Lite用量)、Pro 499元/月(16倍Lite用量)。知乎注意 Token Plan 不是语音专属——千问AI平台近期上的 Qwen3.8-Max、Qwen-image 3.0 pro、Wan3.0,甚至第三方的 Kimi K3,都在同一个 Credits 池子里。如果你本来就在用千问的文本模型,加个语音能力不用多开一份订阅,这是它相对单独的语音API划算的地方。

路线三:Agent玩家,盯紧开源的 Qwen-Audio-Agent。
这是阿里7月底开源的一个实时语音框架,定位很有意思:它不做App,专门给你现有的Agent(OpenCode、Codex 这类编程助手)加上"耳朵和嘴巴",让你用打电话的方式指挥AI干活——你边说边想,它边听边干。微博B站上已经有安装教程,收藏量上百。哔哩哔哩对想给自己的工作流加语音入口的人来说,这可能是三件套里可玩性最高的一个。

Qwen-Audio-3.0上线,官方引用

三盆冷水,也是三份待观察清单

强判断先不下,这三个问题目前都没有答案,建议先放进观察列表:

  1. 真实延迟未知。 端到端延迟目前没有任何可信的公开实测,"打电话级"的体验到底打不打折,要等社区上手测。

  2. 中文方言和噪声待验证。 多方言、情绪语气控制都是官方口径,真实场景(方言、口音、地铁公交噪声)表现还没有第三方数据。

  3. 会不会开源权重。 Qwen 家的音频模型是有开源传统的:Qwen-Audio、Qwen2-Audio 都开放过权重,但这次3.0目前只有API和平台调用。微博微博对本地部署党来说,开不开源是最大变量,值得蹲一个后续。

一句话总结:Qwen-Audio-3.0 把语音AI的竞争方向说得很明白了——不再卷"听得准",而是卷"能打断、边听边说、还能干活"。榜单第一的先别全信,等实测;但如果你受够了语音助手的"对讲机感",现在就可以打开千问App,用嘴跟它聊几句试试。

内容由AI生成

精选参考来源

1. 【识别、合成、实时交互全球第一,Qwen-Audio-3.0 系列语音模型上线阿里千问 AI 平台】阿里云通过公众号宣布,Qwen-Audio-3.0 系列语音模型正式上线千问 AI 平台和阿里云百炼平台。开发者可以通过 API 服务调用模

2. Qwen-Audio-3.0系列语音模型正式上线千问AI平台

3. 试想一下,带外国朋友去日本,他直接说母语,你手机翻译后,对方秒回。 这不是科幻。 阿里刚发了Qwen-Audio-3.0-Realtime实时语音交互模型,在Artificial Analysis评测中,语音推理综合排名第一。 GPT-Re

4. Qwen-Audio-3.0支持边听边说、打断和工具调用,实时语音模型会如何改变AI Agent交互?

5. 千问全新升级|会思考,更会行动

6. 阿里最新开源了一个实时语音Harness:Qwen-Audio-Agent,让你的Agent能像打电话一样对话,你边说边想,它边听边干活简单说就是它给你的OpenCode、OpenClaw、Codex们加上了耳朵和嘴巴,然后你就可以用打电话

7. qwen-audio-agent-全双工实时语音交互agent助手安装教程和注意事项

8. 阿里云宣布通义千问 720 亿参数模型开源IT之家 12 月 1 日消息,阿里云宣布开源通义千问 720 亿参数模型 Qwen-72B、18 亿参数模型 Qwen-1.8B 及音频大模型 Qwen-Audio,目前已上线阿里魔搭社区。

9. 不要再只卷文字输入啦,阿里开源了直接支持语音输入提问的千问多模态大语言模型~!🥹Qwen2-Audio:开启语音对话! | Qwen🧐Qwen2-Audio 是 Qwen-Audio 的升级版本,支持语音聊天和音频分析功能,能够处理超过8种

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章