张大妈

性能比肩Gemini 3 Pro!昨晚,阿里千问最强模型来了

源自公众号:机器之心

01-31 13:13

阿里通义千问最新旗舰模型 Qwen3-Max-Thinking 正式发布,其性能对标国际顶尖水平。该模型通过创新的测试时扩展技术与自适应工具调用机制,在复杂推理与任务执行上实现重大突破,展示了国产大模型的新高度。

性能比肩Gemini 3 Pro!昨晚,阿里千问最强模型来了智能速览

  • Qwen3-Max-Thinking 性能比肩 GPT-5.2 与 Gemini 3 Pro。

  • 模型采用创新的测试时扩展技术,实现更高效的推理。

  • 实测可快速生成完整的五子棋与跳一跳 HTML 互动游戏。

  • 将工具调用内生进思考过程,构建原生 Agent 式框架。

  • 在多项权威基准测试中刷新纪录,综合实力强劲。

性能比肩Gemini 3 Pro!昨晚,阿里千问最强模型来了精华内容

Qwen3-Max-Thinking 的强大并非仅靠规模,其背后是推理机制与工具协同的深度革新。

性能对标国际顶尖

Qwen3-Max-Thinking 拥有超万亿参数和 36T Tokens 的预训练数据,是目前阿里规模最大的模型。在 GPQA Diamond、LiveCodeBench 等 19 项主流评测基准中,该模型取得多项领先成绩。

具体来看,在博士级科学问题(GPQA)上,得分从预览版的 90.3 提升至 92.8;在代码编程(LiveCodeBench v6)上,成绩从 88.0 提升至 91.4。其综合表现已进入与 GPT-5.2-Thinking-xhigh、Gemini 3 Pro 同一的竞争梯队。

突破性重推理模式

推动模型性能跃升的核心是测试时扩展技术,即 Heavy Mode(重推理模式)。这并非简单的多次采样取最优解,而是模仿人类的解题过程。

模型面对复杂问题时,会进入反复的自我反思与迭代推理。通过专有的 take-experience 机制,它能从过往步骤中提炼经验,有效识别死胡同,并将算力聚焦到未解决的关键点上。这种方法在不显著增加 token 成本的前提下,大幅提升了推理效率。

实测代码生成能力

理论之外,Qwen3-Max-Thinking 的实际代码生成能力同样出色。测试中,要求其生成一个带技能的五子棋 HTML 网页,模型迅速生成了超过 1000 行完整可交互的代码。

在难度更高的《跳一跳》游戏生成任务中,模型同样能独立完成所有复杂逻辑的实现,包括按住蓄力、随机平台生成、起跳动画和失败判定等,展现了强大的任务拆解与逻辑构建能力。

内生化的工具协同

Qwen3-Max-Thinking 将工具调用能力内生进思考过程,构建了原生 Agent 式框架。模型不再是先思考后行动,而是边思考、边行动。

通过基于规则奖励与模型奖励的联合强化学习训练,模型学会了何时调用工具、如何结合工具展开推理。它可自主调度搜索、个性化记忆与代码解释器等工具,在一次交互中完成信息获取、计算推演与结论生成,显著降低了模型幻觉。

Qwen3-Max-Thinking 的推出标志着国产大模型进入全新阶段,它将行业焦点从对话智能推向了功能强大的智能体,为解决真实世界的复杂问题打开了新的大门。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章