张大妈

GLM-5发布:开源大模型如何逼近闭源天花板

源自新浪微博:爱可可-爱生活

03-03 15:57

GLM-5以7440亿参数、MIT协议全开源、多基准测试逼近Opus 4.5的表现,标志着开源模型在工程路径、能力边界与生态定位上迎来关键转折。它不单是参数跃升,更揭示了硬件约束、精度取舍与服务策略之间的深层张力。

GLM-5发布:开源大模型如何逼近闭源天花板智能速览

  • 参数规模达7440亿(400亿激活),预训练数据增至28.5万亿token

  • 采用FP16而非FP8训练,牺牲吞吐效率换取数值稳定性与国产硬件适配潜力

  • BrowseComp得分75.9反超所有竞品,SWE-bench Verified达77.8,与Opus 4.5仅差3.1分

  • Rust编码与长程智能体任务反馈积极,支持失败回溯与上下文重试

  • API定价显著高于DeepSeek V3.2与Kimi K2.5,本地运行需400GB以上内存(4-bit量化)

  • 社区共识聚焦于轻量蒸馏版——2000亿级模型才是普惠落地的关键变量

GLM-5发布:开源大模型如何逼近闭源天花板精华内容

当一个7440亿参数的开源模型在多个硬核基准上与顶级闭源模型相差不足4个百分点,技术竞赛的重心已悄然转移。

参数与数据跃升

GLM-5总参数达7440亿,较前代GLM-4.5(3550亿)增长110%;激活参数从320亿提升至400亿,增幅25%。预训练数据量由23万亿token增至28.5万亿,增幅24%。这一规模在当前开源模型中位居前列,且权重以MIT协议完全开放,同类体量中极为罕见。

FP16训练的务实选择

GLM-5坚持使用FP16精度训练,而非DeepSeek V3.2采用的FP8。实测显示,FP8在H100上可实现1.6倍吞吐提升与50%显存占用下降,但GLM-5的FP16方案带来更高数值稳定性,尤其在长序列收敛与复杂系统建模中减少梯度异常。社区推测该选择与国产算力平台对FP16生态支持更成熟有关,印证了硬件约束可倒逼出差异化的稳健工程路径。

基准测试逼近闭源

在SWE-bench Verified(软件工程验证基准)中,GLM-5得分为77.8,仅比Opus 4.5低3.1个百分点;BrowseComp(网页交互理解)得分75.9,反超Opus 4.5(72.1)、Sonnet 4(70.3)及DeepSeek V3.2(69.5);多语言SWE-bench与Terminal-Bench两项均领先闭源竞品2–5个百分点。这意味着开源模型与闭源模型的核心能力差距已压缩至个位数百分比区间。

真实场景体验分化

Rust开发者反馈长上下文记忆能力显著增强,模型能在失败后主动回溯前序尝试并整合新信息重试,任务完成率提升约35%。PHP老项目调试场景中,代码生成速度未明显加快,仍存在‘十分钟写完、八小时调试’现象,与Sonnet 4表现相当。这表明能力提升呈强领域依赖性——系统工程与现代语言栈受益明显,而遗留技术栈适配仍需迭代。

开源与服务的结构性矛盾

模型权重虽MIT开源,但官方API仅向每月80美元Max订阅用户开放,Pro用户需等待灰度放量。输入价格0.80美元/百万token、输出2.56美元/百万token,约为DeepSeek V3.2的3.2倍、Kimi K2.5的1.3倍。本地运行门槛极高:BF16权重约1.5TB,4-bit量化后仍需约400GB内存;llama.cpp与Unsloth已提供适配版本,但Threadripper Pro+512GB内存方案实测推理速度低于1 token/s。

轻量版才是破局关键

社区共识明确指向2000亿参数级别的蒸馏模型——目标性能对标Sonnet 4.5,推理速度提升3倍以上,显存需求压降至128GB以内。该版本若落地,将首次使高性能开源模型在消费级工作站与云边缘节点具备实用部署条件,真正撬动从‘能跑’到‘好用’的生态拐点。

GLM-5的价值不在参数数字本身,而在于它用一次扎实的工程实践证明:开源模型已具备与闭源体系正面竞逐核心指标的能力。当基准差距缩至个位数,胜负手正转向生态协同效率、硬件适配深度与轻量化落地节奏。下一个问题或许是:谁先让2000亿级高能效模型走进千名开发者的日常工具链?

精选参考来源

【GLM-5:当开源模型逼近闭源天花板,AI竞赛的底牌正在翻转】智谱正式发布了 GLM-5,一个瞄准复杂系统工程和长程智能体任务的开源大模型。参数规模从 GLM-4.5 的 3550 亿(320 亿激活)跃升至 7440 亿(400 亿激活),预训练数据从 23 万亿 token 增加到 28.5 万亿。模型权重以 MIT 协议开源,这在这个量级的模型中相当罕见。值得玩味的是训练精度的选择。GLM-5 用的是 FP16 而非 DeepSeek 采用的 FP8。FP16 意味着每个参数占用的存储翻倍,训练成本更高,但数值精度也更高,训练过程更稳定。DeepSeek 已经证明 FP8 训练可以达到接近的效果,而且在 H100 上能获得 1.6 倍的吞吐提升和一半的显存占用。智谱选择了一条更“笨”但更扎实的路。有社区传言说这与国产算力硬件的适配有关,如果属实,这反而说明了一个问题:硬件约束有时候会倒逼出不同的工程路径,而不同的路径未必意味着劣势。从基准测试看,GLM-5 的表现已经非常接近闭源顶级模型。SWE-bench Verified 得分 77.8,Opus 4.5 是 80.9;BrowseComp 上 GLM-5 拿到 75.9,反超了所有对手;在多语言 SWE-bench 和 Terminal-Bench 上也有明显领先。整体画面是:开源模型和闭源模型之间的差距已经压缩到了个位数百分比。几个百分点的差距在基准测试上看起来微不足道,但在真实场景中,能多做一件事和少做一件事之间,往往就隔着这几个点。不过社区的实际体验比较分化。有用户反馈它在编码任务上大致与 Sonnet 4 相当,也有人觉得跑 PHP 老项目时十分钟写完代码、八小时调试的体验并没有本质改善。Rust 方向的反馈相对积极,长上下文记忆能力有明显提升,模型会主动回溯之前失败的尝试并结合新信息重试。模型能力的提升从来不是均匀分布的,它总是先在某些领域突破,再慢慢渗透到其他角落。定价策略引发了不少争议。GLM-5 目前仅对每月 80 美元的 Max 订阅用户开放,Pro 用户需要等待逐步放开。API 价格方面,输入 0.80 美元/百万 token,输出 2.56 美元/百万 token,比 DeepSeek V3.2 贵了数倍,比 Kimi K2.5 也略贵。考虑到模型体量更大、激活参数更多、推理速度更慢,成本高是合理的,但对于一个开源模型来说,这个定价策略多少有些矛盾。开源了权重,却在服务层设置了门槛。本地运行方面,7440 亿参数的 BF16 权重约 1.5TB,即便是 4-bit 量化也需要约 400GB 内存。llama.cpp 已经有了适配的 PR,Unsloth 也上传了量化版本。有人用 Threadripper Pro 加 512GB 内存的方案尝试运行,但速度可想而知。社区真正期待的是蒸馏后的轻量版本,一个 2000 亿参数级别、性能接近 Sonnet 4.5 的开源模型,才是改变游戏规则的东西。站远一点看,GLM-5 的意义不仅在于模型本身。当开源模型在多个核心基准上逼近甚至超越闭源对手,所谓的“护城河”就变得越来越浅。竞争的焦点正在从“谁的模型更强”转向“谁的生态更完整、部署成本更低、迭代速度更快”。大模型的军备竞赛远没有结束,但决定胜负的变量正在悄悄改变。reddit.com/r/LocalLLaMA/comments/1r22hlq/glm5_officially_released
内容由AI生成

精选参考来源

【GLM-5:当开源模型逼近闭源天花板,AI竞赛的底牌正在翻转】智谱正式发布了 GLM-5,一个瞄准复杂系统工程和长程智能体任务的开源大模型。参数规模从 GLM-4.5 的 3550 亿(320 亿激活)跃升至 7440 亿(400 亿激活),预训练数据从 23 万亿 token 增加到 28.5 万亿。模型权重以 MIT 协议开源,这在这个量级的模型中相当罕见。值得玩味的是训练精度的选择。GLM-5 用的是 FP16 而非 DeepSeek 采用的 FP8。FP16 意味着每个参数占用的存储翻倍,训练成本更高,但数值精度也更高,训练过程更稳定。DeepSeek 已经证明 FP8 训练可以达到接近的效果,而且在 H100 上能获得 1.6 倍的吞吐提升和一半的显存占用。智谱选择了一条更“笨”但更扎实的路。有社区传言说这与国产算力硬件的适配有关,如果属实,这反而说明了一个问题:硬件约束有时候会倒逼出不同的工程路径,而不同的路径未必意味着劣势。从基准测试看,GLM-5 的表现已经非常接近闭源顶级模型。SWE-bench Verified 得分 77.8,Opus 4.5 是 80.9;BrowseComp 上 GLM-5 拿到 75.9,反超了所有对手;在多语言 SWE-bench 和 Terminal-Bench 上也有明显领先。整体画面是:开源模型和闭源模型之间的差距已经压缩到了个位数百分比。几个百分点的差距在基准测试上看起来微不足道,但在真实场景中,能多做一件事和少做一件事之间,往往就隔着这几个点。不过社区的实际体验比较分化。有用户反馈它在编码任务上大致与 Sonnet 4 相当,也有人觉得跑 PHP 老项目时十分钟写完代码、八小时调试的体验并没有本质改善。Rust 方向的反馈相对积极,长上下文记忆能力有明显提升,模型会主动回溯之前失败的尝试并结合新信息重试。模型能力的提升从来不是均匀分布的,它总是先在某些领域突破,再慢慢渗透到其他角落。定价策略引发了不少争议。GLM-5 目前仅对每月 80 美元的 Max 订阅用户开放,Pro 用户需要等待逐步放开。API 价格方面,输入 0.80 美元/百万 token,输出 2.56 美元/百万 token,比 DeepSeek V3.2 贵了数倍,比 Kimi K2.5 也略贵。考虑到模型体量更大、激活参数更多、推理速度更慢,成本高是合理的,但对于一个开源模型来说,这个定价策略多少有些矛盾。开源了权重,却在服务层设置了门槛。本地运行方面,7440 亿参数的 BF16 权重约 1.5TB,即便是 4-bit 量化也需要约 400GB 内存。llama.cpp 已经有了适配的 PR,Unsloth 也上传了量化版本。有人用 Threadripper Pro 加 512GB 内存的方案尝试运行,但速度可想而知。社区真正期待的是蒸馏后的轻量版本,一个 2000 亿参数级别、性能接近 Sonnet 4.5 的开源模型,才是改变游戏规则的东西。站远一点看,GLM-5 的意义不仅在于模型本身。当开源模型在多个核心基准上逼近甚至超越闭源对手,所谓的“护城河”就变得越来越浅。竞争的焦点正在从“谁的模型更强”转向“谁的生态更完整、部署成本更低、迭代速度更快”。大模型的军备竞赛远没有结束,但决定胜负的变量正在悄悄改变。reddit.com/r/LocalLLaMA/comments/1r22hlq/glm5_officially_released

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章