张大妈

智谱GLM-4.7评测:国开源大模型的一次突破

源自小红薯:Marley旺财本汪

01-17 16:40

智谱AI发布的GLM-4.7模型在代码生成与复杂推理上实现显著突破,多项基准测试超越前代及部分国际竞品。其开源策略与亲民定价,为开发者和企业提供了新的高性能选择,尤其在编程和逻辑密集型任务中展现出巨大潜力。

智谱GLM-4.7评测:国开源大模型的一次突破智能速览

  • 数学推理能力大幅提升,HLE测试得分达42.8%。

  • 代码能力突出,LiveCodeBench-v6得分84.9分。

  • 工具调用性能超越Claude Sonnet 4.5,交互性增强。

  • 创新引入三种思考模式,提升任务稳定性。

  • 支持本地化部署,订阅价格极具竞争力。

智谱GLM-4.7评测:国开源大模型的一次突破精华内容

GLM-4.7的全面升级并非偶然,其在关键领域的性能提升背后,是具体的技术革新和清晰的应用场景定位,值得深入探究。

推理能力飞跃

GLM-4.7在数学和逻辑推理上实现了质的飞跃。根据HLE基准测试,其得分达到42.8%,相较于前代GLM-4.6提升了41%,这一成绩甚至超越了GPT-5.1模型。

在更高难度的数学竞赛级别测试中,模型表现同样出色:在AIME 2025中准确率达到95.7%,HMMT February 2025为97.1%,在IMOAnswerBench上也获得了82.0%的成绩。这些数据量化了其在处理复杂逻辑和数学问题上的显著进步。

代码生成专精

代码生成是此次更新的核心。GLM-4.7在LiveCodeBench-v6测试中获得84.9分,展现出强大的代码实现能力。

在更具挑战的SWE-bench Verified基准上,模型达到了73.8%的准确率,意味着它能够处理现实世界软件工程中的复杂问题。同时,在多语言代码任务SWE-bench Multilingual上,其准确率也达到66.7%,证明了对多种编程语言的广泛支持。

工具调用革新

除了基础能力,GLM-4.7在工具调用和智能体应用方面也获得大幅增强。在BrowseComp网页任务评测中,它获得67.5分,结合其上下文管理功能,能够更有效地执行网页浏览与信息抓取任务。

更值得注意的是,在τ²-Bench交互式工具调用评测中,GLM-4.7取得了87.4分,这一成绩超过了Claude Sonnet 4.5,表明其在构建和驱动自动化工作流方面具备强大的竞争优势。

部署与成本

为方便开发者使用,GLM-4.7提供了多元化的部署渠道。除了可以通过Z.ai API平台和OpenRouter等在线服务访问,其模型权重已在HuggingFace和ModelScope上公开,支持vLLM和SGLang等主流推理框架进行本地部署,给予了用户极高的灵活性。

在成本方面,订阅GLM Coding Plan的用户能以Claude约七分之一的价格,获得三倍的使用额度,这对中小团队和个人开发者极具吸引力,有效降低了高性能模型的准入门槛。

综合来看,GLM-4.7凭借其在代码、推理和工具调用上的显著进步,已成为国产开源大模型中的一个标杆。其开源策略与高性价比,将进一步推动AI技术的普及和应用创新。这是否会改变开发者对大模型的选择格局?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章