当Claude“消失”之后:开发者们正在悄悄换上GLM-5.2
2026年6月,AI编程圈发生了两件看似不相关的事。
一件是Anthropic发布了号称“史上最强编程模型”的Claude Fable 5,仅几天后,因美国出口管制指令,它对全球大量开发者暂停了访问权限。
另一件是,6月17日,智谱上线并开源了GLM-5.2。有开发者实测后发了一条帖子,大意是:“如果Opus是GLM-5.2冒充的,那用户可能真的分辨不出来。”
这两件事撞在一起,产生了一个微妙的结果:原本依赖Claude工作流的那批开发者,正在寻找替代品。而GLM-5.2,恰好站到了这个缺口上。
“编程御三家”格局正在成形

先看数据。
在Artificial Analysis综合榜单上,GLM-5.2取得51分,位列开源模型SOTA。该榜单显示,智谱已与Anthropic、OpenAI构成“新御三家”格局,超越谷歌Gemini。
在全球百万用户盲测的前端开发评估系统Code Arena上,GLM-5.2拿下1595分,排名总榜第二,在全球可用模型中排名第一。在专门评测“模型品味”的Design Arena上,GLM-5.2更是直接拿下全球第一。
在FrontierSWE编程基准测试中,GLM-5.2得分74.4,仅落后Anthropic Claude Opus 4.8约1个百分点,超过OpenAI GPT-5.5。

简单翻译一下:如果你现在还能用Claude,GLM-5.2跟它的差距已经小到需要拿跑分去抠了。如果你用不了Claude,GLM-5.2就是目前最好的开源替代。
有开发者直言:“这是国内第一款在我工作流上达到Opus级的模型。”海外用户也反馈,GLM-5.2的表现超出预期,“与Fable 5的差距比预期中要小得多。”
智谱创始人唐杰更直接——马斯克预测中国大模型2027年Q1追上Anthropic Fable,唐杰的回应是:“不需要那么久。”
1M上下文的“工程可用”才是真功夫
但真正让开发者愿意“换上”的,不是跑分,是实打实的工程能力。
1M无损上下文,是GLM-5.2最核心的卖点。但智谱相关负责人坦言,单纯扩展到1M并不难,“难的是在实际应用中不劣化”。
智谱花了几个月时间扩展了1M编程智能体的训练环境,覆盖大规模实现、自动化研究、性能优化等多个典型领域。
实际测试中,GLM-5.2自主完成从开发、联调、测试到打包上线的完整链路,最终交付一个覆盖网页、移动端与小程序的多端应用,累计处理88万以上token,几乎用满1M上下文窗口。
过去,这样的大型工程需要一支团队协作数周。GLM-5.2能在一次连续的长程任务中跑完。

在Terminal-Bench 2.1评测中,GLM-5.2得分81.0,较前代GLM-5.1的63.5大幅提升17.5个百分点。
MIT开源 + 国产算力:开发者看到的另一层价值
GLM-5.2的另一个差异化标签是:它不仅是开源的,而且是“不被收走”的。
模型以最宽松的MIT协议开放,可自由下载、部署与商用,无地域限制。发布首日即完成与华为昇腾、平头哥、摩尔线程、寒武纪、昆仑芯、沐曦、海光、壁仞等国产算力平台的推理适配。
在Fable 5因出口管制突然无法访问的背景下,GLM-5.2的这层价值被放大了。智谱的声明说得很直接:“前沿智能不应只属于少数人,也不应被少数规则随时收回。它应该开放、可用、可构建,并服务于每一位开发者。”
成本优势同样突出——同一任务中,GLM-5.2成本为0.06美元,Opus 4.8为0.49美元,成本低逾6倍且响应更快、更省token。

“像Claude,但还没那么听话”
当然,GLM-5.2不是没有争议。
有开发者实测后反馈,GLM-5.2存在自主性不足、运行拥堵及额度消耗快等问题,但整体性能获广泛认可。
有人点赞它的主动性——在任务不清楚时会先反问,而不是直接动手。也有人吐槽它“慢、拥堵、额度消耗快”。
但有意思的是,这些讨论的语气变了。过去人们评价国产模型常说“便宜、能用、省钱”,这次更多人在说“它好像真的能干活了”。在SWE-bench Pro评测中,GLM-5.2得分62.1;在FrontierSWE上得分74.4,超过GPT-5.5。
GLM-5.2没有干掉Claude,但它第一次让开发者认真考虑一个问题:如果把Claude换成国产模型,我的工作流会崩吗?

答案似乎正在浮出水面。
AI研究机构Proximal的评价也许最准确:GLM-5.2是“第一个真正缩小了Anthropic/OpenAI与其他模型提供商之间巨大技术鸿沟的模型”。
