智谱AI发布的GLM-4.7模型在编码能力、推理能力和工具协同方面实现了显著突破。通过引入创新的思考模式和优化机制,该模型在多个基准测试中达到开源SOTA水平,为开发者提供了强大的智能编程助手,开启了智能编程的新时代。
智能速览
GLM-4.7在SWE-bench Verified测试中得分73.8%,达到开源模型SOTA水平
引入交错式、保留式和轮级三种思考模式,提升复杂任务执行稳定性
支持多语言编程,前端UI设计PPT 16:9适配率达91%
工具调用精准度优异,τ²-Bench得分87.4%
API调用成本具有竞争力,支持超长上下文输入
可本地部署,支持vLLM和SGLang等推理框架
精华内容
GLM-4.7作为智谱AI的旗舰大模型,不仅在编码能力上实现了突破,更通过创新的思考机制和工具协同能力,为开发者提供了前所未有的智能编程体验。
编码能力突破
GLM-4.7在编码基准测试中表现卓越。SWE-bench Verified得分73.8%,相比GLM-4.6提升5.8个百分点;SWE-bench Multilingual得分66.7%,提升12.9个百分点;Terminal Bench 2.0得分41%,提升16.5个百分点。这些数据表明GLM-4.7在多语言编程和终端任务处理方面实现了显著进步。
模型支持多语言代码生成、补全、错误修复与重构,能够独立完成高交互小游戏的全流程开发。在前端UI设计方面,GLM-4.7表现出色,PPT 16:9适配率达到91%,生成结果接近即开即用标准。
工具协同能力
GLM-4.7在工具调用能力上表现突出。τ²-Bench得分87.4%,相比GLM-4.6提升12.2个百分点,达到开源SOTA水平。在BrowseComp测试中得分52.0%,提升6.9个百分点;启用上下文管理后得分67.5%,提升10.0个百分点。
模型支持网页浏览、多工具链协同与上下文管理。接入Z.ai平台后,可调度ASR、TTS、GLM-4.6V视觉模型,实现跨技能多模态联动。这种强大的工具协同能力使GLM-4.7能够处理更复杂的任务场景。
创新思考模式
GLM-4.7引入了三种创新思考模式。交错式思考使模型在每次响应和工具调用前进行思考,提升指令遵循和生成质量。保留式思考在多轮对话中自动保留所有思考块,适合长周期复杂任务。轮级思考支持按需启用或禁用思考模式,平衡效率和准确性。
这些思考模式以’任务确定性’为目标,通过可控思考机制约束推理路径,避免发散性输出。用户可以根据任务需求灵活切换推理强度,既能在高精度任务中拉满性能,也能在轻量需求中降低资源消耗。
推理能力增强
GLM-4.7在复杂推理方面表现优异。HLE(人类最后的考试)得分42.8%,相比GLM-4.6提升12.4个百分点;MMLU-Pro得分84.3%,提升1.1个百分点;GPQA-Diamond得分85.7%,提升4.7个百分点。
这些成绩表明GLM-4.7具备强大的跨学科高阶推理能力,可应对复杂的数学和逻辑问题。模型还具备3D粒子动画、交互UI设计能力,支持复杂手势控制逻辑实现,为创作类应用提供了强大的技术支撑。
多场景应用
GLM-4.7在多个应用场景中展现价值。作为智能编程助手,能够生成高质量的多语言代码,支持Claude Code、Kilo Code等编程框架,显著提升开发效率。在前端开发中,可快速生成现代美观的网页布局和幻灯片设计。
在复杂任务规划与执行方面,凭借保留式和轮级思考模式,能够处理多步骤复杂任务,确保长程任务的准确性和稳定性。在教育领域,GLM-4.7为编程教育提供代码示例和练习,帮助学生快速掌握编程技巧。在办公自动化方面,能够自动生成文档、报告和数据分析代码,提升办公效率。
GLM-4.7作为智谱AI的旗舰大模型,通过技术创新实现了编码能力、推理能力和工具协同的全面突破。其优化的思考机制和出色的基准测试成绩,为开发者提供了强大的智能编程工具。随着技术的不断演进,GLM-4.7有望在更多领域发挥更大作用,推动人工智能与编程实践的深度融合。