智谱新发布的开源模型GLM-5,在代码和智能体能力上实现了突破,多项测试中超越谷歌Gemini,性能逼近Claude Opus 4.5。它不仅能写代码,更能完成复杂的系统工程,标志着大模型正从“氛围编程”向“智能体工程”迈进,为开发者提供了全新的生产力工具。
智能速览
GLM-5在编程基准测试SWE-bench中获77.8分,取得开源SOTA。
其智能体能力在VendingBench等评测中表现接近顶级闭源模型。
支持端到端应用开发、全流程编程,并能直接生成办公文档。
模型基座规模扩展,集成了稀疏注意力以降低部署成本。
已完成与华为昇腾、摩尔线程等多家国产算力平台的深度适配。
精华内容
GLM-5的核心价值在于,它不再仅仅是代码生成工具,而是进化为能够独立完成复杂任务的“系统架构师”。
代码能力对标顶尖
在编程能力上,GLM-5的表现达到了开源模型的最高水平。在业内公认的SWE-bench-Verified基准测试中,它获得了77.8的开源最高分;在Terminal-Bench 2.0中则取得了56.2分,性能超越了谷歌的Gemini 3 Pro。
与上一代GLM-4.7相比,GLM-5在前端、后端及长程任务等开发任务上,平均性能增幅超过20%。它能以极少的人工干预,自主完成智能体长程规划与执行、后端重构和深度调试等任务,实际使用体感已非常接近美国Anthropic公司的顶级模型Claude Opus 4.5。
智能体工程实践
GLM-5旨在推动大模型从“氛围编程”向“智能体工程”的变革。其智能体能力在多个评测基准中均取得了开源第一的成绩,特别是在需要长程规划和资源管理的任务中表现突出。
例如,在衡量模型经营能力的VendingBench2测试中,GLM-5通过为期一年的模拟自动售货机经营,最终账户余额达到4432美元,展现了出色的长期规划和资源管理能力。这表明模型不仅能执行,还能在长程任务中保持目标一致性,处理多步骤依赖关系。
落地场景多样化
凭借强大的端到端交付能力,GLM-5已催生出丰富的应用案例。在匿名上线期间,开发者用它制作了横版解谜游戏、智能体交互世界等可部署的应用,这些案例已开放下载或提交审核。
在编程工具ZCode中,用户只需描述需求,模型便能自动拆解任务,并发完成编码、调试、预览和提交的全流程。此外,GLM-5还能直接输出产品需求文档、教案、电子表格等多种办公文档格式,实现文本到结构化文件的直接转换。
技术底座再升级
GLM-5的强大能力源于其全面升级的底层技术。模型的参数规模从355B(激活32B)扩展至744B(激活40B),预训练数据量也从23T提升至28.5T,更大规模的算力投入显著提升了其通用智能水平。
智谱构建了全新的“Slime”框架以支持更复杂的强化学习任务,并提出了异步智能体强化学习算法。首次集成的DeepSeekSparseAttention(稀疏注意力)机制,在维持长文本效果无损的同时,大幅降低了模型部署成本。
国产算力强支撑
GLM-5的成功发布,离不开国产算力芯片的坚实支撑。智谱相关负责人表示,依托众多国产芯片,有力保障了GLM-5线上服务的稳定与高效。
目前,GLM-5已完成与华为昇腾、摩尔线程、寒武纪、昆仑芯、沐曦、燧原、海光等国产算力平台的深度推理适配。通过底层的算子优化与硬件加速,GLM-5在国产芯片集群上已实现高吞吐、低延迟的稳定运行,为大规模应用奠定了基础。
智谱GLM-5的出现,不仅刷新了开源模型的能力上限,更预示着一个由智能体驱动的新开发时代。当AI能独立完成端到端的工程项目,开发者的工作方式将如何被重新定义?这值得每一位技术从业者深思。