Qwen3-Max-Thinking模型登场,宣称在多项能力上媲美顶尖水平。经过实际测试,该模型在复杂推理等核心任务上确实展现出惊人潜力,但也在部分基础功能上暴露了意想不到的短板,其综合表现值得深入探讨。
智能速览
在19项权威基准测试中,性能可媲美GPT-5.2-Thinking等顶尖模型。
复杂推理与工具调用能力突出,成功解决其他模型均失败的难题。
代码生成与图片理解能力表现稳定,能够完成具体指令任务。
文生视频功能存在明显缺陷,文字理解和声音合成效果不佳。
网页搜索功能出现严重问题,直接返回了404错误页面。
精华内容
Qwen3-Max-Thinking的登场引发了广泛关注,其实际表现究竟如何?通过一系列实测,它在推理、代码等核心能力上展现了惊人潜力,但也暴露了一些意想不到的短板。
推理能力超群
该模型最亮眼的表现集中在复杂推理和工具调用上。在一个关于国内身份证号码是否包含完全平方数的难题测试中,Qwen3-Max-Thinking是唯一成功自主调用工具并给出符合规则正确答案的模型。
此前,这道题曾让DeepSeek、Gemini、Grok等多个知名模型纷纷失败,足见其在此类高难度逻辑推理问题上的突破性进展。
多模态表现不一
在代码生成方面,模型能够稳定地根据要求编写出军旗版2048游戏,代码能力可靠。图片生成功能也表现合格,能够理解并创作出符合描述的抽象风格图像。
然而,文生视频功能则暴露了明显短板。虽然模型能初步理解古风歌词的意境,但在生成的视频中,文字出现错误,且声音合成效果存在严重问题,体验不佳。
基础功能翻车
令人意外的是,模型在网页搜索这一基础功能上出现了重大失误。在执行搜索指令时,它未能返回有效信息,而是直接提供了一个404错误网页。
对于一个被寄予厚望的顶尖模型而言,本应最为可靠的搜索功能反而成为薄弱环节,这表明其在功能稳定性和全面性上仍有待完善。
综合体验强劲
综合来看,Qwen3-Max-Thinking的实际体验非常出色。评测者推测其参数量可能达到千亿级别,但使用时的响应延迟依然在可控范围内。
尽管存在部分功能缺陷,但其强大的核心能力足以使其成为目前非常实用的AI工具。这也解释了为何有用户已经为其在百炼平台进行了充值,体现了市场的积极反馈。
Qwen3-Max-Thinking无疑为国产大模型阵营注入了一剂强心针,尤其在推理能力上的突破令人印象深刻。它证明了国内模型在处理复杂问题上已具备顶级竞争力。未来的挑战在于如何补齐短板,实现更全面、更稳定的能力覆盖。
关键评论
国产这些模型每次出来一个就遥遥领先。结果一用一个不吭声。
max应该是qwen语言模型系列唯一不开源的,很多人把这玩意忘了。
试了下,比deepseek v3.2强,离GPT5.2还有些差距。
真挺强的,第一次有模型上来就把国内公共节假日调休问题回答正确。