通义千问发布两大重要更新,为AI开发者和用户带来全新体验。一方面,Qwen3-TTS全系列模型开源,让高质量、可定制的语音合成触手可及;另一方面,Qwen3-Max-Thinking模型上线,通过创新的推理技术,让大模型具备更深入的思考与解决问题的能力。这些进展展示了AI在生成与理解两个维度上的显著突破。
智能速览
Qwen3-TTS开源,支持3秒克隆声音与自然语言指令控制音色。
Qwen3-TTS端到端合成延迟低至97ms,支持10种语言。
Qwen3-Max-Thinking模型上线,在多项基准测试中媲美顶尖模型。
新模型引入自适应工具调用与测试时扩展技术,提升复杂推理能力。
Qwen3-Max-Thinking的API已开放,兼容OpenAI调用方式。
精华内容
从让每个人都能定制自己的声音,到打造一个更会思考的智能体,通义千问的这两项更新,分别从创造和推理两个层面,拓展了AI的应用边界。
声音的极致定制
Qwen3-TTS模型的开源为语音合成带来了高度自由。其核心亮点在于仅需3秒音频样本即可完成音色克隆,同时支持通过自然语言描述来创造全新音色,无论是“暴躁川普大叔”还是“撒娇萝莉音”,都能精准生成。该能力背后是自研的Qwen3-TTS-Tokenizer-12Hz技术,它能高效编码声音,完整保留情感与气息等细节,为高保真还原奠定了基础。
此外,模型还提供精细化的指令控制,用户可以具体定义音色质感、情绪、语速、音量等参数,实现对语音生成的全方位掌控,甚至能让AI带着哭腔或以威严宣告的语气说话,表现力极为丰富。
高效低延迟合成
在实际应用中,Qwen3-TTS的性能表现同样出色。得益于创新的Dual-Track流式生成架构,模型实现了边输入边播放的实时体验,端到端合成延迟最低可达97毫秒,确保了交互的流畅自然。
为满足从云端到边缘设备的多样化部署需求,本次开源提供了1.7B(极致性能)和0.6B(轻量高效)两个版本。模型还支持包括中、英、日、韩在内的10种语言,并能准确朗读拼音、数学公式和表情符号,应用场景广泛。综合评测显示,Qwen3-TTS在音色创造、控制与克隆任务上均展现出超越对应闭源模型的领先性能。
更会思考的模型
通义千问同步推出了Qwen3-Max-Thinking模型,这是对前代版本的重大升级。通过增加模型规模和强化训练,该模型在事实知识、复杂推理、指令遵循等五大维度实现全面跃升。在19项权威基准测试中,其性能已可媲美GPT-5.2-Thinking-xhigh、Claude Opus 4.5等业界顶尖模型。
例如,在GPQA Diamond基准测试中,其得分从87.4提升至92.8;在Humanity’s Last Exam中,从49.8提升至58.3,尤其在需要调用工具的场景下表现绝对领先。这标志着大模型在解决高难度问题上迈出了坚实一步。
自适应推理能力
Qwen3-Max-Thinking的强大能力源于两大核心创新。首先是自适应工具调用能力,模型能根据对话上下文,智能判断何时需要调用搜索引擎或代码解释器来获取信息或执行计算,目前已上线Qwen Chat。
其次是创新的测试时扩展技术(TTS),这是一种经验累积式、多轮迭代的推理策略。模型在推理过程中会不断从自身步骤中提炼洞见,避免重复推导,从而聚焦于未解问题。面对复杂难题时,模型能“沉住气”,通过自我反思一步步逼近正确答案,显著提升了在相同token消耗下的推理质量。
通义千问此次发布的Qwen3-TTS与Qwen3-Max-Thinking,分别代表了AI在声音生成与逻辑推理两个前沿方向的显著进步。开源与开放API的举措,将加速这些先进技术的普及与应用。当AI不仅能说会道,还能深入思考,我们与智能的交互方式将迎来怎样的变革?