GLM-4.5系列模型导读,综合能力更强的高性价比模型

2025-10-23 19:17:28

GLM-4.5在智能体编程上的表现确实亮眼,工具调用成功率超过Claude和Kimi,说明国产模型在复杂任务协同上已经走出自己的路子。不过真实开发环境比测试复杂得多,能不能稳定发挥还得看实际落地情况

GLM-4.5系列模型导读,综合能力更强的高性价比模型
AI为你总结

全文概述

GLM-4.5系列模型采用MOE架构和混合推理模式,提升了推理、代码与智能体能力。其参数效率高,性能强,在多项基准测试中表现优异,尤其在智能体编程任务中表现出色。API调用成本低且速度快。

模型架构与特点

GLM-4.5系列包含两个主要模型:GLM-4.5(355B总参数)和GLM-4.5-Air(106B总参数),均采用MoE架构。混合推理模式提供思考模式和非思考模式,分别用于复杂推理和即时响应。

训练过程与优化

预训练阶段使用了15万亿tokens的通用语料库和7万亿tokens的代码与推理语料库。引入了无损负载均衡路由、sigmoid门控机制、GQA、部分旋转位置编码等技术,并使用Muon优化器加快收敛速度。

强化学习与后训练

通过基于难度的课程学习策略进行一阶段RL训练,结合动态采样温度机制提升训练稳定性。智能体编程任务使用可扩展策略自动构造样本,依赖实际软件工程任务中的执行反馈驱动训练。

评测性能对比

在12项行业标准基准测试中,GLM-4.5取得了63.2分的综合成绩,排名第三。在代码生成和智能体任务方面,GLM-4.5的表现优于多个竞争对手,如Kimi-K2和Qwen3-Coder。

真实数据评估

CC-Bench测试集评估显示,GLM-4.5在52个编码任务中表现出色,平均工具调用成功率达到90.6%。该测试涵盖前端开发、应用开发、UI/UX优化等多个领域,确保了模型在真实场景中的有效性。

API兼容性与成本

GLM-4.5 API兼容多种AI编程工具,如Claude Code、Gemini CLI等。API调用价格最低为输入0.8元/百万tokens,输出2元/百万tokens,具有较高的性价比。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
0
扫一下,分享更方便,购买更轻松