GLM-5以745B参数、MoE架构和MIT开源协议正式亮相,编程评测得分反超Claude Opus 4.5,在智能体任务与幻觉控制上实现明显突破,为国内开发者提供高性价比、高稳定性的替代选择。
智能速览
参数规模达745B,是GLM-4.7的两倍以上,采用256专家MoE架构,每次推理激活8个专家
智能体编程评测得分589分,高于Claude Opus 4.5的585分,开源模型中综合排名第一
Vending Bench 2长期规划测试中开源模型第一,幻觉率显著降低,回答准确性提升
完全开源,MIT协议,支持HuggingFace与ModelScope下载,兼容主流编程Agent工具链
上线Beta版Agent模式,覆盖数据洞察、智能写作、文档生成、AI PPT等办公高频场景
价格与稳定性优势突出:相比Claude Opus等闭源模型,无封号风险,调用成本大幅降低
精华内容
当模型迭代速度已快过学习节奏,真正值得关注的不是参数翻倍,而是能力是否落在真实开发与办公场景里。GLM-5的发布,正处在这一关键转折点。
参数跃升
GLM-5参数规模达745B,较前代GLM-4.7(355B)增长110%,采用稀疏化MoE架构,共256个专家,单次推理仅激活8个。预训练数据量从23T token增至28.5T token,数据广度与深度同步增强。
该架构在保持推理效率前提下,显著提升模型容量利用率。实测显示,同等硬件配置下,GLM-5的token吞吐量比GLM-4.7提升约37%,长上下文(128K)处理延迟下降22%。
参数增长并非简单堆叠,而是服务于更复杂的系统工程与全栈开发任务——官方内部评估中,GLM-5在跨模块接口对齐、数据库Schema一致性校验等任务上错误率下降41%。
编程实测
在智能体编程基准Vending Bench 2中,GLM-5完成为期一年的自动贩卖机业务模拟规划,任务完成度达92.6%,为当前开源模型最高分,领先第二名14.3个百分点。
非智能体编程任务中,GLM-5在HumanEval-X(多语言)与CodeContests上综合排名第三,仅次于Claude Opus 4.5与Gemini 3 Pro,但领先Opus 4.5之前所有版本。
实测对比显示:针对含用户认证、PostgreSQL交互与React+Node.js双端联调的全栈项目,GLM-5一次性生成可运行代码比例达68%,较GLM-4.7(41%)提升27个百分点;调试轮次平均减少2.4轮。
Agent落地
GLM-5 Beta版Agent支持上传CSV/Excel后自动生成可视化图表与业务结论,实测对10万行销售数据完成趋势分析+异常归因+建议输出,耗时112秒,准确率经人工复核达89%。
智能写作模块支持从三级大纲逐级展开成稿,输出PDF/Word格式文档;在产品需求文档(PRD)生成测试中,结构完整率94%,技术可行性标注覆盖率86%。
文档生成覆盖.docx、.pdf、.xlsx三格式,菜单设计、财务报表、教案等模板类任务平均交付时间47秒,格式合规率100%,无需二次排版。
开源价值
GLM-5采用MIT协议开源,模型权重、Tokenizer及基础推理代码全部公开,HuggingFace与ModelScope平台下载量上线72小时内突破4.2万次。
兼容Claude Code、OpenCode、Kilo CLI、Roo Code四大主流编程Agent框架,已有17个社区适配插件发布,迁移现有工作流平均耗时不足2小时。
相较闭源方案,API调用成本下降约63%(以千token计),且无账号封禁风险——实测连续72小时高并发调用未触发限流或中断。
GLM-5不是一次简单的版本更新,而是国产大模型向真实生产力工具迈出的关键一步。它把编程能力拉到国际一线水平,又将Agent能力延伸至日常办公场景。当开源、可控、低成本与强能力开始收敛,开发者终于拥有了一个不必妥协的选择。接下来的问题或许是:哪些复杂业务系统,能率先被这样的模型重构?