GLM5以744B参数、MOE架构与深度国产芯片适配,实测编程与Agent能力达开源第一。它不再仅是代码助手,而是能规划系统、经营模拟的系统级AI,标志着国产大模型进入能力跃迁新阶段。
智能速览
参数规模翻倍至744B,预训练数据达28.5T tokens,激活参数提升至40B
采用256专家MOE架构,每次动态激活8个专家,部署成本降低30%以上
SWE Bench Verified得分77.8、Terminal Bench 2.0得分56.2,均为当前开源模型第一
在VendingBench2经营模拟中实现4432美元账户余额,展现强规划与决策能力
完成华为昇腾、摩尔线程等7家国产芯片深度适配,实现全栈自主可控
MIT协议开源,支持RTX 4090等消费级GPU部署,显著降低开发者参与门槛
精华内容
当一个模型能在自动售货机经营模拟中达成4432美元收益,在真实工程问题评测中超越所有开源对手,它的意义已远超技术参数本身。
参数跃升
GLM5参数量达744B,较前代GLM-4的355B实现翻倍增长。预训练数据扩容至28.5T tokens,相当于模型‘阅读’文本量增加近一倍。实测表明,在相同任务下,其上下文理解准确率提升19%,长文档摘要关键信息召回率达92.3%,较GLM-4提高11.7个百分点。这一规模跃升直接支撑了复杂推理与多步骤任务的稳定性。
MOE架构实效
GLM5首次在国产大模型中规模化应用256专家MOE架构,单次推理仅激活8个专家。对比同等参数量的稠密模型,其推理延迟降低37%,显存占用减少42%。在本地RTX 4090部署测试中,7B精调版本可稳定维持28 token/s输出速度,而同配置下运行稠密744B模型会触发显存溢出。该设计使高性能与低门槛首次实现兼容。
编程能力突破
在SWE Bench Verified评测中,GLM5得分77.8,大幅领先第二名Qwen2.5-72B(68.1分),成为首个在该权威工程评测中登顶的开源模型。其解决GitHub真实Issue的成功率达63.4%,其中涉及多文件协同修改、测试用例生成与CI流程修复的完整链路成功率超51%。终端操作类任务(Terminal Bench 2.0)得分56.2,接近Cloud Open 4.5的58.9分,证明其已具备生产环境级脚本编写与系统管理能力。
Agent能力进阶
GLM5在BriarsComp、MCP Atlas与TU SquareBench三项Agent专项评测中全部位列开源第一。VendingBench2经营模拟测试中,模型自主完成选品、定价、库存补货、故障响应全流程,最终账户余额达4432美元,超出基线模型均值2.3倍。这反映其任务分解准确率提升至89%,跨步骤状态一致性保持时间延长至平均17步,已初步具备长周期目标导向行为能力。
国产化落地
GLM5完成与华为昇腾910B、摩尔线程MTT S4000、寒武纪MLU370等7款国产AI芯片的全栈适配,推理吞吐量达同类国际模型在对应芯片上的94%-102%。在昇腾910B单卡环境下,744B模型INT4量化后推理速度达15.8 token/s,较未适配版本提升2.1倍。这意味着核心算法与底层硬件首次实现性能对齐,摆脱对英伟达A100/H100的依赖。
GLM5的价值不仅在于刷新开源榜单,更在于它验证了一条可行路径:通过架构创新平衡性能与成本,借力国产硬件实现技术自主,以真实场景评测定义能力边界。当模型开始经营售货机、搭建高并发电商系统,AI正从工具层迈向系统层。下一个问题或许是:谁将率先把这种系统级智能,转化为普通人可感知的产品体验?