GLM-5不再满足于生成文本或单步代码,而是以端到端完成项目、模拟一年自动售货机运营等实测表现,验证了其在复杂系统工程与长周期智能体任务上的实质性突破。
智能速览
参数规模达744亿,预训练数据量提升至28.5万亿token
Vending Bench 2测试中账户余额达4432美元,开源模型排名第一
支持直接生成可交付的.docx、.pdf、.xlsx专业文档
slime异步强化学习基础设施显著提升后训练迭代效率
MIT许可证开源,兼容Claude Code与OpenClaw生态
精华内容
当模型能独立运行一台自动售货机整整一年,并最终实现4432美元盈利时,它已超越‘助手’范畴,成为可托付流程的工程参与者。
真实项目闭环能力
GLM-5在内部评估中展现出完整项目交付能力:从前端页面搭建、后端接口开发,到调试优化与部署执行,全程无需人工介入干预。实测显示,其编程任务性能较GLM-4.7提升超20%,真实编码体验接近Claude Opus 4.5水平。区别于传统模型仅输出代码片段,GLM-5可自主启动本地服务、验证API响应、修复常见错误并生成部署说明文档。
长期智能体验证
在Vending Bench 2基准测试中,GLM-5需连续模拟经营一台自动售货机12个月,涉及库存补货决策、动态定价调整、故障报修响应、季节性促销规划及现金流管理。最终账户余额为4432美元,在全部开源模型中位列第一,与Claude Opus 4.5的4680美元差距不足6%。该结果表明其具备稳定的多目标权衡能力与跨周期资源调度逻辑。
工程友好型架构
GLM-5采用DeepSeek稀疏注意力机制(DSA),将长文本推理显存占用降低约38%,同时维持128K上下文窗口的完整性。配套自研slime强化学习基础设施,使后训练吞吐量提升2.3倍,支持更细粒度的任务反馈建模。两项技术协同,使模型在CC-Bench-V2前端、后端及长周期任务子项上,平均得分较GLM-4.7提高19.7%。
即用型文档生成
GLM-5支持从自然语言指令直接生成结构化交付物:输入‘生成一份面向初中生的光合作用教案,含课时安排与随堂测验’,输出为格式规范的.docx文件;输入‘按Q3财务数据整理销售分析报告’,输出含图表与结论的.pdf。实测生成的PRD文档通过87%的工程师可读性抽检,电子表格公式准确率达92%。
GLM-5标志着国产大模型正从语言理解跃迁至系统级工程实践。它不追求单项指标的极致,而是在推理深度、任务跨度与交付质量之间建立新平衡。当模型开始承担真实业务周期中的责任,我们真正需要思考的,不再是‘它能不能做’,而是‘它该承担哪些环节的决策权’。