GLM-5作为7440亿参数的混合专家模型,在系统架构和长程任务处理上展现出顶尖实力。它不仅解决了前代模型规划能力不足的问题,更在多个智能体测试中超越了Claude 4.5 Opus的表现,为开源AI领域带来了新的突破。
智能速览
GLM-5是7440亿参数的混合专家模型,实际激活400亿参数
系统规划能力显著提升,能理解产品整体架构
长程任务处理能力碾压级提升,甚至超越Claude 4.6
智能体测试排名第一,代码质量和持续执行能力强
性价比突出,API价格预计上调但依然很有竞争力
权重将开源,支持OpenCore等工具链
精华内容
GLM-5的实测表现令人印象深刻,特别是在系统架构设计和长程任务处理方面的突破,让这个开源模型真正具备了挑战闭源巨头的实力。
参数规模提升
GLM-5拥有7440亿总参数,采用混合专家架构,实际使用时激活400亿参数。相比上一代GLM4的3550亿总参数和320亿激活参数,规模几乎翻倍。虽然参数量接近万亿级别的Kimi,但激活参数相对较小,在性能和成本之间找到了很好的平衡点。
模型权重将开源,这意味着开发者可以自由部署和定制。虽然API定价可能会上调,但考虑到性能提升和相对较低的成本,性价比依然很高。代码生成套餐的价格预计保持不变,对开发者来说是个好消息。
系统规划革新
GLM-4.7在规划、调试等任务上表现不佳,经常跳过步骤或无法理解整体架构。GLM-5在这方面实现了质的飞跃,规划能力接近甚至超越了Claude Opus和Codex的水平。
在OpenCoder或KiloCoder的设置中开启规划模式,GLM-5会先检查文件和系统架构,然后提出详细计划。更重要的是,它现在会主动询问澄清需求,而不是死守初始指令。这种交互方式的改进让开发体验更加顺畅。
长程任务突破
在长程任务处理上,GLM-5实现了碾压级的提升。相比于GLM-4.7的不错表现和Opus 4.6的退步,GLM-5甚至超过了Codex的表现。它做事有耐心,会仔细检查代码规范问题,发现错误立刻修正。
测试中,一个复杂的图片裁剪编辑工具任务持续了3个小时,虽然最终勉强完成且存在一些漏洞,但展现了模型强大的执行力和持续完成任务的能力。这种坚持到最后的品质在代码生成智能体中尤为珍贵。
智能体测试领先
在多个智能体测试中,GLM-5表现卓越。Expo开发的MovieTracker应用仅用一条指令,40分钟就生成了功能完备、设计精良的版本,远超Opus的表现。它还会自动运行Lint检查、用Curl命令检查前端错误,这些细节处理很出色。
终端计算器、Svelte看板应用、Nuxt的防Stack Overflow网站等项目,GLM-5都完成得比Opus 4.6和Codex更好。在智能体榜单上排名第一,每项任务都能成功跑通,生成的代码质量高且不会为了省令牌而妥协。
GLM-5的崛起标志着开源AI在系统级应用上实现了重大突破。它不仅在技术指标上逼近甚至超越了闭源巨头,更以开源的形式降低了AI开发的门槛。未来,随着模型权重开源和生态完善,GLM-5有望成为开发者的主力选择,推动AI应用向更系统化、专业化的方向发展。这个开源新王真的能改变AI格局吗?