张大妈

憋了4个月,阿里最大最强模型正式版发布,附一手实测

源自今日头条:36氪

01-28 18:20

阿里推出了其能力最强的旗舰模型Qwen3-Max-Thinking。该模型的核心亮点在于自适应工具调用能力,能自主判断并使用搜索或代码解释器,同时其独特的推理策略提升了效率。在与GPT-5.2-Thinking等顶尖模型的基准测试中表现不俗,为探索高效AI路径提供了新思路。

憋了4个月,阿里最大最强模型正式版发布,附一手实测智能速览

  • Qwen3-Max-Thinking在19项权威基准测试中与顶尖模型表现相当。

  • 具备自适应工具调用能力,可自主使用搜索引擎和代码解释器。

  • 采用新型测试时扩展策略,实现更精准、高效且会“反思”的推理。

  • 实测中,其自适应搜索和信息核验能力优于部分现有模型。

  • 模型API定价为输入2.5元/百万tokens,输出10元/百万tokens,性价比突出。

  • 相较预览版,正式版在编程审美和UI生成效果上有所进步。

憋了4个月,阿里最大最强模型正式版发布,附一手实测精华内容

这款新模型不仅追上了国际顶尖水平,更在工具调用与推理效率上展现了独特的技术思考,其核心价值在于提升AI解决问题的实际能力。

自适应工具调用

基于实测体验,Qwen3-Max-Thinking的自适应工具调用能力表现突出。当被问及“Clawdbot是啥”时,模型在初步判断知识库不足后,会主动启动搜索引擎,并给出完整介绍。这一点优于某些模型在遇到未知信息时直接拒绝回答的做法。

在编程任务上,要求其“模拟抛掷硬币1000次并验证大数定律”,模型能自主调用代码解释器,编写超过60行Python代码完成任务,并生成图表。对于需要结合实时信息的复合任务,如查询股价并生成图表,模型能同时调用搜索和代码工具,尽管搜索方式有待优化,但最终能满足基本分析需求。

高效推理机制

Qwen3-Max-Thinking的核心升级在于其测试时扩展策略。不同于行业主流的“堆并行推理路径”,该模型限制了并行分支数量,将计算资源集中于更“聪明”的推理过程本身。通过“经验提取”机制,模型能从过往推理轮次中提炼关键信息,避免重复推导,聚焦于未解决的不确定性。

这种以效率为导向的策略,在GPQA、HLE等需要深度推理的基准测试中,带来了2至4分的性能提升。这意味着在相近的token消耗下,模型能获得更优的上下文利用效率和推理准确率。

性能对比实测

在19项权威基准测试中,Qwen3-Max-Thinking的综合实力与GPT-5.2-Thinking、Claude-Opus-4.5等顶尖模型不相上下,尤其在MMLU-Pro、GPQA等知识推理和STEM领域表现出色。

与自家Preview版本对比,正式版在处理“种群模拟器”这类复杂任务时,更倾向于使用代码解释器生成图表,且在一次生成结果的丰富度和UI审美上均有明显进步。有实测显示,该模型能准确绕开逻辑陷阱,分析数据趋势而不会编造信息。

成本与应用

目前,Qwen3-Max-Thinking已正式上线Qwen Chat并向公众开放,用户可以直接体验其自适应工具调用功能。同时,其API也已同步开放。

定价策略颇具竞争力,输入成本为2.5元/百万tokens,输出成本为10元/百万tokens。这一价格使其在商业应用和开发者社区中具备了较高的性价比,为大规模落地提供了可能。

Qwen3-Max-Thinking的发布,展现了中国大模型在算力约束下追求“精耕细算”的技术路线。通过提升推理效率而非单纯堆砌算力,为行业可持续发展提供了新范本。未来,这种高效能模型会如何改变AI应用生态?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章