GLM-5.2编程直逼Opus?深度实测揭示其真实战力与短板

源自21位全网作者

06-17 07:21

近期,智谱AI发布的GLM-5.2模型在开发者社区引发了广泛讨论,其核心焦点在于:这款国产模型的编程(Coding)能力是否已经具备了挑战甚至超越业界顶尖产品如Anthropic的Claude Opus系列(特别是Opus 4.7)的实力。综合多方实测与反馈,我们可以得出一个多维度的结论。

在衡量模型解决真实世界软件工程问题能力的权威基准测试SWE-bench上,GLM-5.2取得了亮眼的成绩。官方公布其在SWE-bench Verified得分达到77.8%,刷新了开源模型的历史纪录。这一分数不仅超越了前代GLM-5.1,也使其在解决真实GitHub仓库中的Bug修复等硬核任务上,进入了与全球顶级闭源模型正面竞争的第一梯队。

除了基准测试跑分,更具说服力的是来自开发者在真实项目中的体验。多项独立的工程评测显示,GLM-5.2在处理复杂任务时表现出色。例如,在一项包含5个真实工程项目的评测中,GLM-5.2拿到了3个“A”档评价,这意味着模型能精准理解需求、几乎不犯错,其表现与Opus 4.8持平。不过需要注意的是,这些评测样本量相对较小,结论主要反映了在特定场景下的优异表现。

GLM-5.2编程直逼Opus?深度实测揭示其真实战力与短板

具体到开发流程中,许多开发者反馈GLM-5.2展现出了“工程师”而非“代码片段生成器”的特质。在处理一个真实的Rust项目或从零构建一个复杂的Three.js太阳系3D项目时,模型不再是直接上手写代码,而是会先进行规划、提出问题、确认方案,然后再分步执行。这种“先思考再动手”的模式,以及在过程中自我审查、发现并修复问题、补充测试、通过代码质量门禁的能力,被认为是其核心竞争力的体现,非常接近Claude系列模型备受称赞的“专业体感”。

长上下文能力是GLM-5.2的另一大亮点。其宣称的1M(百万)Token上下文窗口在实测中被证实“真实可用”,在长达数小时的连续编码任务或处理整个代码库时,模型能够保持逻辑连贯,不会“失忆”。有用户反馈,将几十万条服务器日志投喂给它,GLM-5.2能准确追溯到数周前的根本原因,这种能力对于调试和理解大型项目至关重要。

然而,要说GLM-5.2已经全面超越Opus 4.7,结论还为时过早。它也存在一些明显的短板。最常被提及的是响应速度问题,在一些评测中,完成同一任务的耗时远超其他模型。有开发者指出,GLM-5.2虽然主动性强,但有时会“不太听话”,用自己的默认设定覆盖用户的明确指令,需要使用者反复纠正。此外,在UI审美和创意灵感方面,其表现相对朴素,不如顶级模型那般富有创造力。在推理和数学等领域,也被认为能力偏弱,更适合执行已有清晰规划的工程任务,而非开拓未知领域。

综合来看,GLM-5.2在核心的工程执行能力、复杂任务拆解和长上下文稳定性上,确实已经达到了可以与Opus 4.7等顶级模型在同一水平线上竞争的程度。许多开发者认为,它是第一款在实际工作流中能达到Opus级体验的国产模型。但它在响应速度、指令遵循的灵活性以及创意输出等方面仍有差距。

因此,GLM-5.2的出现,并未宣告对Opus的完胜,但它无疑将竞争带入了一个新阶段。开发者在选择工具时,不再只有一个昂贵的闭源选项。尤其在部分海外前沿模型访问受限的背景下,GLM-5.2的强大实力与即将开源的承诺,使其成为了一个极具吸引力的、能够承接真实、复杂工程任务的可靠备选。它能否最终超越Opus,取决于其在补足短板、优化体验以及持续迭代上的后续努力。

内容由AI生成

精选参考来源

1. 5 个工程测评拿 3 个 A:GLM-5.2 真能平替 Opus 吗

5 个工程测评拿 3 个 A:GLM-5.2 真能平替 Opus 吗 5 个工程测评拿 3 个 A:GLM-5.2 真能平替 Opus 吗peterzen1781419842 744B MoE + 小

2. GLM-5.2 实测|我随手让它画了个银河……

GLM-5.2 实测|我随手让它画了个银河…… 今天 GLM-5.2 拉过来重度跑了跑,先把判断放前面:这是智谱第一个真正的能直接拉出去和 Claude、GPT 的模型相比的。我估计有 opus4.6

3. 我拿 GLM-5.2 跑了个真项目,不是写 Demo

我拿 GLM-5.2 跑了个真项目,不是写 Demo 这次没有让模型写贪吃蛇,也没有做玩具级 benchmark。 我直接把它扔进一个真实的 Rust 项目里:A 股化工行业股票池分析工具。 任务不算

4. GLM5.2 深度评测|复杂 3D 图形项目实战

GLM5.2 深度评测|复杂 3D 图形项目实战 让它从零造一个 Three.js 真 3D 太阳系。八大行星加矮行星和卫星齐全,土星环和彗星也做了。纹理全部程序化生成,零图片依赖。1347 行代码,

5. GLM-5.2慢到45分钟,国产Coding模型反而把Claude打疼了

GLM-5.2慢到45分钟,国产Coding模型反而把Claude打疼了 GLM-5.2慢到45分钟,国产Coding模型反而把Claude打疼了敲代码的猴子1781407842 GLM-5.2这波最

6. Fable 5突遭下架,GLM-5.2全量开放!

Fable 5突遭下架,GLM-5.2全量开放! Fable 5突遭下架,GLM-5.2全量开放!新智元1781361233 【新智元导读】GLM-5.2全量开放!1M上下文真能用,长任务不忘事。昨晚

7. 智谱旗舰 GLM-5 实测:对比 Opus 4.6 和 GPT-5.3-Codex

智谱旗舰 GLM-5 实测:对比 Opus 4.6 和 GPT-5.3-Codex 智谱旗舰 GLM-5 实测:对比 Opus 4.6 和 GPT-5.3-Codex阮一峰的网络日志177086308

8. GLM 5.2口碑贴

GLM 5.2口碑贴 欢迎来到 GLM 5.2 口碑众测贴! 大家期待已久的 GLM 5.2 已经来了。作为智谱新一代大模型,它在推理、长文本、多语言等方面的表现究竟如何?是“史上最强国产大模型”的实

9. 从Claude Fable5被禁看国产模型机遇(GLM-5.2/Kimi K2.7 Code等)1️⃣【Fable5全面...

从Claude Fable5被禁看国产模型机遇(GLM-5.2/Kimi K2.7 Code等)1️⃣【Fable5全面... 从Claude Fable5被禁看国产模型机遇(GLM-5.2/Kimi

10. GLM-5.2初体验来了:像Claude,但还没那么听话

GLM-5.2初体验来了:像Claude,但还没那么听话 GLM-5.2初体验来了:像Claude,但还没那么听话新浪财经1781521328 来源:市场资讯(来源:网易智能)出品 | 网易智能作者

11. glm-5.2果然强!

glm-5.2果然强! 借技术群的爆款宣传贴的话来说,0612注定是载入史册一天! 智谱突然发布核弹 GLM-5.2 引爆AI圈,Anthropic 慌忙下架 fable 5 暂避锋芒![汗颜R]

12. GLM-5.2 深度测评|稳扎稳打的"优等生"🤖

GLM-5.2 深度测评|稳扎稳打的"优等生"🤖 一句话总结:GLM-5.2 是一次扎实的升级。体感整体水平约在 Claude Opus 4.7 ~ 4.8 之间。 我的体感来源标准主要是:在一个中大

13. GLM-5.2!第一时间测评

GLM-5.2!第一时间测评 GLM-5.2 全量上线 Coding Plan,这波我是真的有点兴奋。 智谱在 GLM-5.1 阶段就已经把 coding 能力讲到对齐 Opus 4.6 的位置了,所

14. GLM-5.2真实体验:最强的工程执行者

GLM-5.2真实体验:最强的工程执行者 对 GLM 体验的进一步总结: 优点: 它不像GPT那样做一步就要停下来请示,也不像Claude那样总爱自作主张加一些“好意”但偏离方向的代码。GLM在工

15. 从Claude Fable5被禁看国产模型机遇(GLM-5.2/Kimi K2.7 Code等)1【Fable5全面禁售...

从Claude Fable5被禁看国产模型机遇(GLM-5.2/Kimi K2.7 Code等)1【Fable5全面禁售... 从Claude Fable5被禁看国产模型机遇(GLM-5.2/Kimi

16. 有点惊喜,GLM-5.1在SWE Bench Pro表现很稳

有点惊喜,GLM-5.1在SWE Bench Pro表现很稳 刚看到一个挺炸的消息。智谱GLM-5.1在SWE-Bench Pro上拿了全球最高分,超了GPT-5.4和Opus 4.6。这个榜不是背题

17. 最强国产模型GLM-5.2正式全量发布

最强国产模型GLM-5.2正式全量发布 6月13日,智谱AI宣布旗下旗舰大模型GLM-5.2面向GLM Coding Plan全量用户开放,覆盖Lite、Pro、Max及团队版多个档位。作为智谱迄今为

18. GLM5.2开源了,大家用起来觉得怎么样

GLM5.2开源了,大家用起来觉得怎么样 如题 这边A÷拿下fable5,智谱就宣布glm5.2开源 请教一下大家,glm5.2能力大概对标a厂哪一代 我个人是 CC+GLM 个人测试下来感觉比5.1

19. AI的考题你能拿几分,AI Benchmark 大盘点

AI的考题你能拿几分,AI Benchmark 大盘点 “GPT-5.4 在 OSWorld-Verified 测试得分 75% 取得 SOTA” “MiniMax M2.7 在 SWE-Pro 测试

20. 智谱最强模型发布!编程对齐Claude Opus 4.5,七家国产芯片已火速适配

智谱最强模型发布!编程对齐Claude Opus 4.5,七家国产芯片已火速适配 智谱最强模型发布!编程对齐Claude Opus 4.5,七家国产芯片已火速适配智东西1770866822 智东西作者

21. 智谱GLM-5技术全公开!完全适配华为等国产芯片,美国网友酸了

智谱GLM-5技术全公开!完全适配华为等国产芯片,美国网友酸了 智谱GLM-5技术全公开!完全适配华为等国产芯片,美国网友酸了量子位1771821709 金磊 发自 凹非寺量子位 | 公众号 Qbit
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章