8月17日,阿里把 Qwen-Audio-3.0 全家桶——ASR(语音识别)、TTS(语音合成)、Realtime(实时对话)——一次性上线了千问AI平台和阿里云百炼,开发者可以直接走 API 调用,也可以通过订阅 Token Plan 使用。微博
官方口径相当高:按照今年7月 Artificial Analysis 的语音榜单,三个赛道全部拿到全球第一,号称“大满贯”。知乎
模型听着是挺强的,但“到底怎么用”这件事,信息散落在一个多月的新闻里:7月15日发 Realtime、7月20日发 TTS、7月30日开源语音 Agent 框架、8月7日上线独立的 CosyVoice Studio 平台、8月17日才在百炼全面开放。单看哪一条都拼不全,今天一次性说清楚:它能干什么、入口有几个、不同的人该走哪个、坑在哪里。

三个模型,分别能干啥
Qwen-Audio-3.0-ASR 负责“听”。亮点不在准确率本身(官方口径错字率1.7%),而在两个实用痛点:长音频和行业词。几个小时的会议、访谈里,它会参考前文已识别的内容,同一个人名、同一个术语不会因为跨了段落就认错。内置医疗、IT 编程等行业词库,官方数据里医疗词汇的“听中率”到 95.36%。知乎还能自己加热词(品牌名、人名、内部黑话),官方测试听中率 90% 以上。官方文章里那张三列对比表,展示的正是同一段话在有无上下文记忆加持下的识别差异。

另一个省事的地方:它识别的同时就把润色干了。“那个”“嗯”这类口头禅、说话人自己改口的部分,直接整理成书面文本,不用再挂一个文本大模型做二次处理。官方测试里,润色后的可读性平均分从 2.55 提到 3.43。另外支持 30 种语言,中英日混着说的跨国会议也能直接开“多语言混合识别”。
Qwen-Audio-3.0-TTS 负责“说”。官方给的数据:单次合成最长 3 分钟。知乎支持 16 种语言和 20 种方言,可以用自然语言指令控制情绪、语气、节奏——“带点笑意说”“放慢、温柔一点”这种话它能直接听懂。小红书面向实时交互的 Flash 版本,官方口径首包延时约 300 毫秒。小红书短视频口播、有声内容配音、语音助手播报,都在它的射程内。官方贴出的 Artificial Analysis 语音竞技场截图里,Qwen-Audio-3.0-TTS-Plus 排在 Elo 榜第一——注意,这是官方自己贴的榜单截图,当参考看,别当公证结果。

Qwen-Audio-3.0-Realtime 负责“聊”,也是三个里最值得关注的。传统语音助手是对讲机模式:你说完,它再答。这个是按全双工做的——边说边听,随时打断插话,在餐厅这种嘈杂环境里不会被背景噪声误触发,多人场景还能锁定主说话人。口语化表达也不掉智商:VoiceBench 语音问答基准上,Plus 版标准提示词 92.5 分、口语化提示词 90.5 分,只差 2 分。知乎
更关键的是“能聊天还能办事”:不用刻意说“帮我打开某某”,它自己会调外部工具,兼容 MCP、API 和知识库,调用结果还会进对话记忆——先问“附近有什么川菜馆”,再追问“评分4.5以上哪家最近”,它能接着上次的结果继续查。知乎支持上传音频样本锁定声纹,分 Plus(推理更强)和 Flash(更快)两个版本,都已在百炼开放。官方发布的 Realtime 能力概览图,把这些能力拆得很直观。

四个入口,给的是完全不同的人
很多人看到“语音大满贯”就想冲,结果打开手机发现不知道从哪进——因为这个系列的入口有四个,对应的人群完全不一样。
入口一:千问 App / 千问办公。适合只想体验语音对话的普通用户。但注意节奏问题:官方通稿说该系列已在千问 App、千问办公、Qoder 等产品中应用。知乎不过有社区用户核对阿里云的两页官方资料后提醒,更新是真的,但消费端功能是分步开放的,普通用户先别急着去 App 里找按钮。小红书一时找不到对应入口不用慌,不是你打开方式不对。
入口二:CosyVoice Studio。8月7日上线,定位“一站式AI语音生产力平台”,iOS、安卓、Mac、Windows 全端客户端,目前限时免费。微博三块功能:CosyFlow 做录音转写,CosyAgent 做语音智能体,CosyCreative 做音频创作,覆盖会议纪要、播客制作、语音键盘这些场景——语音键盘能把带口头禅的大白话直接整理成逻辑清晰的书面文本。微博打工人、自媒体人、想用嘴代替手写字的,走这个,不用碰代码。最近小红书上一堆“语音写周报”“科研语音工作流”的帖子,聊的基本就是它。

入口三:百炼 API。开发者走这里,三个模型全部开放调用,按量付费,也可以订阅 Token Plan。百炼对新用户有免费额度,有用户实测盘点过,单个模型能领到 100 万 token 级别的试用额度,足够先把链路跑通再决定花不花钱。知乎想做语音客服、会议助手、配音工具,或者给自己的应用接语音能力的,从这里进。提醒一句:语音类模型的计费和文本模型不是一个口径,调用前先在百炼控制台看清对应模型的价格和免费额度范围。
入口四:开源自部署。7月底阿里开源了实时语音框架 Qwen-Audio-Agent,简单说就是给 OpenClaw、OpenCode、Codex 这些命令行 Agent 加上耳朵和嘴——你可以像打电话一样跟 AI 协作:你边说它边干,随时插话补充,它边干活边汇报。微博官方帖里那张架构图,前台是全双工语音层、后台对接各类 Agent 的结构,一眼就能看明白。已经在本地养龙虾的应该懂这个含金量。另外 CosyVoice3 语音合成模型也能本地跑,6GB 显存就够,适合对隐私敏感、不想为 API 花钱的。

三盆冷水,动手前先看
第一,“大满贯”是官方基于 Artificial Analysis 榜单的口径。榜单成绩不等于你的实际体验,尤其是重方言、重噪音、重行业词的场景,商用之前务必自己拿真实数据测一遍。
第二,别把名字搞混。Qwen-Audio 是模型系列,CosyVoice Studio 是应用产品,Qwen-Audio-Agent 是开源框架,百炼是 API 平台,四个是上下游关系,不是一个东西。找教程、提问之前先搞清楚自己说的是哪一层,能省一半弯路。
第三,免费窗口期不一定是永久的。CosyVoice Studio 的“限时免费”什么时候截止、部分企业功能的白名单测试什么时候放开,官方都没给准话。想薅的趁早;想放进正式项目的,预算里留个备份方案。
一句话总结:谁现在该动手
纯体验党:直接下 CosyVoice Studio 全端客户端,限时免费,语音键盘和会议转写最直观;
Agent 玩家:先玩开源的 Qwen-Audio-Agent,给你的龙虾加上耳朵和嘴;
开发者:上百炼控制台,用免费额度把三个模型的 API 各跑一遍,体验完再决定付不付费;
重方言、高精度场景:先别动,等第三方实测多一些再说。
接下来值得盯三个信号:语音模型的 API 定价细则会不会有调整、App 端功能什么时候全量跟上、Studio 的免费政策会不会转正。这三个任何一个落地,上面这份入口选择都会跟着变。