阿里通义千问最新旗舰模型 Qwen3-Max-Thinking 正式发布,其性能对标国际顶尖水平。该模型通过创新的测试时扩展技术与自适应工具调用机制,在复杂推理与任务执行上实现重大突破,展示了国产大模型的新高度。
智能速览
Qwen3-Max-Thinking 性能比肩 GPT-5.2 与 Gemini 3 Pro。
模型采用创新的测试时扩展技术,实现更高效的推理。
实测可快速生成完整的五子棋与跳一跳 HTML 互动游戏。
将工具调用内生进思考过程,构建原生 Agent 式框架。
在多项权威基准测试中刷新纪录,综合实力强劲。
精华内容
Qwen3-Max-Thinking 的强大并非仅靠规模,其背后是推理机制与工具协同的深度革新。
性能对标国际顶尖
Qwen3-Max-Thinking 拥有超万亿参数和 36T Tokens 的预训练数据,是目前阿里规模最大的模型。在 GPQA Diamond、LiveCodeBench 等 19 项主流评测基准中,该模型取得多项领先成绩。
具体来看,在博士级科学问题(GPQA)上,得分从预览版的 90.3 提升至 92.8;在代码编程(LiveCodeBench v6)上,成绩从 88.0 提升至 91.4。其综合表现已进入与 GPT-5.2-Thinking-xhigh、Gemini 3 Pro 同一的竞争梯队。
突破性重推理模式
推动模型性能跃升的核心是测试时扩展技术,即 Heavy Mode(重推理模式)。这并非简单的多次采样取最优解,而是模仿人类的解题过程。
模型面对复杂问题时,会进入反复的自我反思与迭代推理。通过专有的 take-experience 机制,它能从过往步骤中提炼经验,有效识别死胡同,并将算力聚焦到未解决的关键点上。这种方法在不显著增加 token 成本的前提下,大幅提升了推理效率。
实测代码生成能力
理论之外,Qwen3-Max-Thinking 的实际代码生成能力同样出色。测试中,要求其生成一个带技能的五子棋 HTML 网页,模型迅速生成了超过 1000 行完整可交互的代码。
在难度更高的《跳一跳》游戏生成任务中,模型同样能独立完成所有复杂逻辑的实现,包括按住蓄力、随机平台生成、起跳动画和失败判定等,展现了强大的任务拆解与逻辑构建能力。
内生化的工具协同
Qwen3-Max-Thinking 将工具调用能力内生进思考过程,构建了原生 Agent 式框架。模型不再是先思考后行动,而是边思考、边行动。
通过基于规则奖励与模型奖励的联合强化学习训练,模型学会了何时调用工具、如何结合工具展开推理。它可自主调度搜索、个性化记忆与代码解释器等工具,在一次交互中完成信息获取、计算推演与结论生成,显著降低了模型幻觉。
Qwen3-Max-Thinking 的推出标志着国产大模型进入全新阶段,它将行业焦点从对话智能推向了功能强大的智能体,为解决真实世界的复杂问题打开了新的大门。