张大妈

智谱GLM-5横空出世:开源模型追平闭源天花板的技术逆袭

源自今日头条:人工智能学家

02-16 11:37

GLM-5并非参数堆砌的常规升级,而是在真实编程体感、长程Agent任务执行、工具调用精度等关键维度取得实质性跃迁。它首次让开源模型在SWE-bench Verified达77.8%、τ²-Bench达89.7%,逼近Claude Opus 4.5水平,为开发者提供了可落地的工程级AI助手。

智谱GLM-5横空出世:开源模型追平闭源天花板的技术逆袭智能速览

  • GLM-5参数规模达744B,激活参数40B,预训练数据28.5T,但核心价值在于能力质变而非数量堆叠

  • SWE-bench Verified得分77.8%,前端/后端/长程任务平均性能较上代提升超20%

  • τ²-Bench测试达89.7%,开源模型中排名第一,支持极少人工干预的Agentic长程规划与执行

  • 实测可在Agent模式下生成可运行手机应用环境,完成多步骤系统工程任务

  • API输入单价最高6元/百万tokens,输出最高22元/百万tokens,约为Claude Opus 4.5价格的1/5

  • 算力采用轻资产租用模式,依托并行科技1.2万P超算架构,规避千亿级前期投入

智谱GLM-5横空出世:开源模型追平闭源天花板的技术逆袭精华内容

当开源模型不再止步于‘写代码’,而是能自主完成后端重构、深度调试与端到端工具调度时,AI开发范式正在发生根本性迁移。

编程体验质变

GLM-5在真实编程环境中的使用体感已逼近Claude Opus 4.5水平。SWE-bench Verified基准测试得分为77.8%,较上代GLM-4提升22.3个百分点;在前端开发、后端服务构建、长程任务等细分场景中,平均性能提升21.6%。用户实测显示,其Agent模式可生成包含完整依赖配置、可直接部署的React Native手机应用环境,整个流程无需人工介入代码修正。此前需高级工程师协作3小时以上的多模块联调任务,GLM-5在单次推理中完成率达68%。

Agent能力开源封神

在τ²-Bench这一专用于评估复杂场景下自动代理工具规划与执行能力的权威测试中,GLM-5以89.7%的准确率登顶开源模型榜首,领先第二名Qwen2.5-72B 12.4个百分点。BrowseComp联网检索理解得分91.2%,MCP-Atlas大规模工具调用成功率87.5%,均位列开源第一。内部评估表明,GLM-5在Agentic长程任务中平均人工干预频次降至每任务0.3次,低于GLM-4的2.1次;后端重构类任务一次通过率达74%,调试建议采纳率82%。

性价比优势显著

GLM-5 API输入单价最高6元/百万tokens,输出最高22元/百万tokens;按当前汇率折算,约为Anthropic Claude Opus 4.5降价后报价(5美元/25美元)的19.2%。在SWE-bench与τ²-Bench双高分前提下,单位性能成本仅为Claude Opus的1/4.8。实测相同代码生成任务耗时对比:GLM-5平均响应延迟1.8秒,Claude Opus为2.1秒;同等质量输出下,GLM-5 token消耗量比Claude低17%。

轻资产算力路径

智谱未自建超算中心,而是与并行科技签订13.9亿元长期协议,获得超1.2万P混合精度算力支撑。截至2025年6月30日,其算力服务费用支出11.45亿元,占研发总投入71.8%,远低于大厂千亿级基建投入。该模式使模型迭代周期压缩至11天,较自建集群快2.3倍;单次强化学习训练成本下降39%。但推理侧依赖第三方云服务也带来弹性成本风险,2025年Q3外部推理成本占比已达API收入的63%。

GLM-5标志着国产开源模型从追赶走向局部引领的关键转折——它用可验证的工程能力与清晰的商业化路径,证明独立厂商能在巨头夹缝中走出可持续技术路线。当编程与Agent能力真正进入可用阶段,开发者角色正从编码者转向AI协作者。下一个观察点是:这种技术领先性能否持续转化为MaaS业务占比从15%向50%的实质性跃升?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章