智谱AI发布的GLM-4.7模型在代码生成与复杂推理上实现显著突破,多项基准测试超越前代及部分国际竞品。其开源策略与亲民定价,为开发者和企业提供了新的高性能选择,尤其在编程和逻辑密集型任务中展现出巨大潜力。
智能速览
数学推理能力大幅提升,HLE测试得分达42.8%。
代码能力突出,LiveCodeBench-v6得分84.9分。
工具调用性能超越Claude Sonnet 4.5,交互性增强。
创新引入三种思考模式,提升任务稳定性。
支持本地化部署,订阅价格极具竞争力。
精华内容
GLM-4.7的全面升级并非偶然,其在关键领域的性能提升背后,是具体的技术革新和清晰的应用场景定位,值得深入探究。
推理能力飞跃
GLM-4.7在数学和逻辑推理上实现了质的飞跃。根据HLE基准测试,其得分达到42.8%,相较于前代GLM-4.6提升了41%,这一成绩甚至超越了GPT-5.1模型。
在更高难度的数学竞赛级别测试中,模型表现同样出色:在AIME 2025中准确率达到95.7%,HMMT February 2025为97.1%,在IMOAnswerBench上也获得了82.0%的成绩。这些数据量化了其在处理复杂逻辑和数学问题上的显著进步。
代码生成专精
代码生成是此次更新的核心。GLM-4.7在LiveCodeBench-v6测试中获得84.9分,展现出强大的代码实现能力。
在更具挑战的SWE-bench Verified基准上,模型达到了73.8%的准确率,意味着它能够处理现实世界软件工程中的复杂问题。同时,在多语言代码任务SWE-bench Multilingual上,其准确率也达到66.7%,证明了对多种编程语言的广泛支持。
工具调用革新
除了基础能力,GLM-4.7在工具调用和智能体应用方面也获得大幅增强。在BrowseComp网页任务评测中,它获得67.5分,结合其上下文管理功能,能够更有效地执行网页浏览与信息抓取任务。
更值得注意的是,在τ²-Bench交互式工具调用评测中,GLM-4.7取得了87.4分,这一成绩超过了Claude Sonnet 4.5,表明其在构建和驱动自动化工作流方面具备强大的竞争优势。
部署与成本
为方便开发者使用,GLM-4.7提供了多元化的部署渠道。除了可以通过Z.ai API平台和OpenRouter等在线服务访问,其模型权重已在HuggingFace和ModelScope上公开,支持vLLM和SGLang等主流推理框架进行本地部署,给予了用户极高的灵活性。
在成本方面,订阅GLM Coding Plan的用户能以Claude约七分之一的价格,获得三倍的使用额度,这对中小团队和个人开发者极具吸引力,有效降低了高性能模型的准入门槛。
综合来看,GLM-4.7凭借其在代码、推理和工具调用上的显著进步,已成为国产开源大模型中的一个标杆。其开源策略与高性价比,将进一步推动AI技术的普及和应用创新。这是否会改变开发者对大模型的选择格局?