GLM-5.3 API上线,编程能力提升50%,权重下周开源

源自366位全网作者

12:01

精选参考来源

1
实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键
2
智谱 AI(Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。【1】编程:开源阵营里最强,但离闭源前沿还有距离GLM-5.3 在多个编程基准上拿到了开源模型(开放权重模型)的最高分。比如 Terminal Bench 3.0,GLM-5.2 只有 4.6 分,5.3 跳到了 28.3。DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 到 28.5。在智谱自建的 Z.ai Code Bench 上,GLM-5.3 在 Max 级别用大约 7.5 万 Token 就达到了 34.5% 的完成率,而 GLM-5.2 用了 9.6 万 Token 才拿到 23.4%,能力和效率同时提升。不过对照闭源模型,差距仍然存在。在 Z.ai Code Bench 上 Fable 5 达到 39.5%,ExploitBench 上 Fable 5 拿了 78.0 而 GLM-5.3 是 54.4。整体格局是:开源第一,全局第二梯队。【2】网络安全能力"涌现":他们自己也没完全预料到智谱说,他们在后训练中加入了漏洞发现相关的数据和环境,本来预期模型会在识别漏洞方面有所提升。结果超出了预期:模型不只是在找漏洞,还开始自主规划完整的漏洞利用链条。数字上看,CyberGym(白盒源码审计)GLM-5.3 拿了 84.5%,全场最高,超过 GPT-5.6 Sol 的 83.6% 和 Fable 5 的 83.8%。ExploitBench(要求对真实漏洞进行更深层的利用推理)从 GLM-5.2 的 24.4% 跳到 54.4%,翻了一倍多。ExploitGym(限时完成漏洞利用任务数量)从 29/39 涨到 105/130。规律很明显:越靠近利用链的后端,进步越大。智谱用了"涌现"(emergent)这个词,意思是这个能力不是他们专门去训练的,而是在扩大 RL 规模的过程中自然冒出来的。这个说法如果属实,对 AI 安全领域是个需要关注的信号。【3】在 269 个开源项目中发现 2,436 个真实漏洞跑分只是一面。更引人注意的是,智谱说从 GLM-5.2 开始就和国内安全团队合作,用模型扫描真实代码库。经专家审核和去重后,模型在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个是中高危级别。涉及的项目覆盖了操作系统内核、浏览器引擎、网络协议等核心基础设施,有些漏洞在代码里藏了几十年,最老的一个可以追溯到约 40 年前。目前 53 个漏洞已公开披露,2,383 个仍在保密期。智谱还上线了一个公开的漏洞披露追踪页面(Z.ai Security Disclosure Ledger),持续更新进度。这和今年 4 月 Anthropic 公布 Claude Mythos 发现大量零日漏洞的路径很像,但有一个关键区别:Mythos 被美国政府严格限制了使用范围,只对少数审核过的安全机构开放。而 GLM-5.3 的权重将在两周后公开发布。一个能力接近的漏洞发现引擎,即将以开源形式进入公共领域。【4】技术栈:用 slime 框架不换底座只加训练所有这些提升背后的技术逻辑:不换基座模型,靠扩大后训练规模。具体来说,智谱在 GLM-5.2 时期搭建了三个核心组件:IndexShare(长上下文处理)、SAO(长周期任务的 RL 算法)、以及开源的 slime 框架(大规模异步训练基础设施)。GLM-5.3 的做法就是在这套栈上继续堆:更多环境、更多样的任务、更多训练计算。训练环境的设计也在变。新的环境不再像编程练习题,而是模拟资深工程师的真实工作场景,有些任务相当于一个有经验的工程师需要干好几天的活,比如在一个完整的 ML 基础设施环境里诊断训练瓶颈、实现优化、跑实验、交付可验证的端到端加速。为了规模化生产这些训练环境,智谱还搭建了自动合成环境的流水线:研究智能体从真实工作中提取任务模式,生成可执行的长周期环境,评判智能体再验证任务是否可解。这套流水线仍然需要人工参与,但让环境的生产效率提高了很多。【5】怎么用API 已经上线,所有 GLM Coding Plan 用户都可以使用,支持 ZCode、Claude Code、OpenCode 等编程智能体工具。GLM-5.3 不再支持关闭思维链(thinking),只能在 low、high、max 三个思考级别之间切换。编程任务推荐用 max。计费改为积分制,非高峰时段(工作日 14:00-18:00 北京时间以外的所有时段,包括周末)消耗标准积分的 50%。通过 ZCode 使用还能享受 98% 以上的缓存命中率和限时 1.5 倍额度加成,叠加后相当于标准额度的 180%,活动截止到 8 月底。模型权重两周后公开发布。官网:网页链接
全部
来源
内容由AI生成

精选参考来源

1. 实测GLM-5.3: 在神仙打架的一周杀回国模顶流,还按下了重置键

2. 智谱 AI(Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。【1】编程:开源阵营里最强,但离闭源前沿还有距离GLM-5.3 在多个编程基准上拿到了开源模型(开放权重模型)的最高分。比如 Terminal Bench 3.0,GLM-5.2 只有 4.6 分,5.3 跳到了 28.3。DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 到 28.5。在智谱自建的 Z.ai Code Bench 上,GLM-5.3 在 Max 级别用大约 7.5 万 Token 就达到了 34.5% 的完成率,而 GLM-5.2 用了 9.6 万 Token 才拿到 23.4%,能力和效率同时提升。不过对照闭源模型,差距仍然存在。在 Z.ai Code Bench 上 Fable 5 达到 39.5%,ExploitBench 上 Fable 5 拿了 78.0 而 GLM-5.3 是 54.4。整体格局是:开源第一,全局第二梯队。【2】网络安全能力"涌现":他们自己也没完全预料到智谱说,他们在后训练中加入了漏洞发现相关的数据和环境,本来预期模型会在识别漏洞方面有所提升。结果超出了预期:模型不只是在找漏洞,还开始自主规划完整的漏洞利用链条。数字上看,CyberGym(白盒源码审计)GLM-5.3 拿了 84.5%,全场最高,超过 GPT-5.6 Sol 的 83.6% 和 Fable 5 的 83.8%。ExploitBench(要求对真实漏洞进行更深层的利用推理)从 GLM-5.2 的 24.4% 跳到 54.4%,翻了一倍多。ExploitGym(限时完成漏洞利用任务数量)从 29/39 涨到 105/130。规律很明显:越靠近利用链的后端,进步越大。智谱用了"涌现"(emergent)这个词,意思是这个能力不是他们专门去训练的,而是在扩大 RL 规模的过程中自然冒出来的。这个说法如果属实,对 AI 安全领域是个需要关注的信号。【3】在 269 个开源项目中发现 2,436 个真实漏洞跑分只是一面。更引人注意的是,智谱说从 GLM-5.2 开始就和国内安全团队合作,用模型扫描真实代码库。经专家审核和去重后,模型在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个是中高危级别。涉及的项目覆盖了操作系统内核、浏览器引擎、网络协议等核心基础设施,有些漏洞在代码里藏了几十年,最老的一个可以追溯到约 40 年前。目前 53 个漏洞已公开披露,2,383 个仍在保密期。智谱还上线了一个公开的漏洞披露追踪页面(Z.ai Security Disclosure Ledger),持续更新进度。这和今年 4 月 Anthropic 公布 Claude Mythos 发现大量零日漏洞的路径很像,但有一个关键区别:Mythos 被美国政府严格限制了使用范围,只对少数审核过的安全机构开放。而 GLM-5.3 的权重将在两周后公开发布。一个能力接近的漏洞发现引擎,即将以开源形式进入公共领域。【4】技术栈:用 slime 框架不换底座只加训练所有这些提升背后的技术逻辑:不换基座模型,靠扩大后训练规模。具体来说,智谱在 GLM-5.2 时期搭建了三个核心组件:IndexShare(长上下文处理)、SAO(长周期任务的 RL 算法)、以及开源的 slime 框架(大规模异步训练基础设施)。GLM-5.3 的做法就是在这套栈上继续堆:更多环境、更多样的任务、更多训练计算。训练环境的设计也在变。新的环境不再像编程练习题,而是模拟资深工程师的真实工作场景,有些任务相当于一个有经验的工程师需要干好几天的活,比如在一个完整的 ML 基础设施环境里诊断训练瓶颈、实现优化、跑实验、交付可验证的端到端加速。为了规模化生产这些训练环境,智谱还搭建了自动合成环境的流水线:研究智能体从真实工作中提取任务模式,生成可执行的长周期环境,评判智能体再验证任务是否可解。这套流水线仍然需要人工参与,但让环境的生产效率提高了很多。【5】怎么用API 已经上线,所有 GLM Coding Plan 用户都可以使用,支持 ZCode、Claude Code、OpenCode 等编程智能体工具。GLM-5.3 不再支持关闭思维链(thinking),只能在 low、high、max 三个思考级别之间切换。编程任务推荐用 max。计费改为积分制,非高峰时段(工作日 14:00-18:00 北京时间以外的所有时段,包括周末)消耗标准积分的 50%。通过 ZCode 使用还能享受 98% 以上的缓存命中率和限时 1.5 倍额度加成,叠加后相当于标准额度的 180%,活动截止到 8 月底。模型权重两周后公开发布。官网:网页链接

3. 【GLM-5.3:用魔鬼训练压榨出Base模型的“暴力”网络安全潜能】Z.ai发布的GLM-5.3证明了Post-training的极限:在不改变Base模型的前提下,通过大规模强化学习和环境模拟,其编码能力在Z.ai Code Bench上提升了50%,并在网络安全领域实现了能力涌现。它不仅能识别孤立漏洞,还能进行跨阶段的漏洞利用链推理,目前已在真实项目中发现两千多个漏洞,其中最古老的潜伏了45年。官方承诺两周后发布Open Weights,并支持从low到max三档Thinking推理级别。这次更新戳破了一个幻觉:模型能力的提升不一定非要靠堆参数量。当OpenAI和Anthropic的闭源模型因为安全合规被锁死在拒答的牢笼里时,GLM-5.3这种实战派正在填补安全审计的权力真空。社区敏锐地捕捉到了这种经济学降维打击——对于需要处理复杂逆向或漏洞挖掘的开发者,闭源模型的过度保护已成阻碍,而一个能自我进化出攻击视角的开放权重模型,才是真正能干活的专家。这标志着AI竞争已从单纯的算力竞赛,转向了对高质量训练环境和长程任务逻辑的深度挖掘。

4. GLM-5.3 来了:底座没换,编程暴涨 50%,还顺手揪出潜伏 40 年的世界级漏洞

5. #AI热点周报# 这周科技圈信息量爆炸,几个值得关注的点:【OpenAI年收冲刺400亿美元】年化营收较2025年底翻倍,7月环比增速超20%。企业业务收入首次超过消费者业务,广告业务年化收入接近10亿美元。IPO进程明显加速,但核心高管接连离职也引发关注。【谷歌Gemini 3.7 Flash发布】距上代仅三周,编码能力提升33%,首发价格直接砍半。三周一更的节奏说明谷歌急了——Flash系列正成为快速迭代的主力引擎,而旗舰Gemini 4还在路上。【智谱GLM-5.3开源登顶】基座模型没变,纯靠后训练Scaling把编程能力拉高50%,多项基准开源第一,两周后开放权重。Terminal-Bench 3.0从4.6飙到28.3,性价比超Fable 5约20倍。【华强北AI眼镜销量翻倍】日均8000外籍客商扫货,AI产品占比从41%跃升至61%。“上午设计、下午打样、次日量产、一周出海”——中国供应链速度正在定义全球AI硬件格局。【抖音入股未来不远机器人】联合纳爱斯战略入股家庭机器人公司,加码具身智能C端布局。500户家庭、5万小时真实数据,可能是比PPT更硬的壁垒。一个观察:AI竞赛正从“拼参数”转向“拼落地”——谁能更快把技术变成产品、把产品送进用户手里,谁才能拿到下一阶段的入场券。你最看好哪个方向?#科技热点##人工智能##具身智能##微博AI创作季##微博新知##科技妈咪##热搜ai创作激励大赛#

6. GLM-5.3发布,基座没变,能力却涨了

7. 【虾虾大脑”升级:荣耀 YOYO Claw 官宣接入智谱最新发布的 GLM-5.3 大模型】荣耀全场景软件主理人 席迎军 昨晚宣布,荣耀 YOYO Claw 正式接入智谱最新发布的 GLM-5.3 大模型,“虾虾大脑”全新升级。通过更大规模、更长周期、更多样任务环境的后训练,GLM-5.3 进一步释放模型能力上限:编程能力较上一代提升 50%,并在多项公开基准测试中取得开源模型第一;在代码审查、漏洞发现等网络安全任务中,能力也进一步提升,表现更加优秀。在今年 4 月的荣耀 PC 新品技术沟通会上,荣耀版“龙虾”YOYO Claw 发布。官方在现场进行了多个场景演示,包括媒体运营助虾、3D 打印虾等。另外,YOYO Claw 于 3 月 27 日开启封测,支持跨端执行任务,也可以选择“荣耀虾”进行养殖,包括荣耀 PC、荣耀 Pad 设备。此外,YOYO Claw 也能连接第三方龙虾,包括其他设备上的 OpenClaw。作为参考,智谱昨日正式发布 GLM-5.3,与 GLM-5.2 相比,基座模型没变,但通过后训练 Scaling 大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。相比前代,GLM-5.3 的新能力包括:更强的编程能力。GLM-5.3 是编程能力最强的开源模型,在内部自建体感评测中较 GLM-5.2 提升 50%,在包括 Terminal Bench 3.0、Agents' Last Exam (CLI) 在内的公开基准测试中取得开源第一。网络安全能力。在白盒代码审查与漏洞发现等安全任务中,GLM-5.3 的表现持平 Mythos 5,展现出面向网络安全防御场景的强大潜力。后训练 Scaling。上述全部提升都来自后训练。基于 IndexShare、SAO、以及持续演进的新一代 Slime 框架,智谱在与 GLM-5.2 完全相同基座上高效推进强化学习,可能智谱还远未开发出这个基座的智能上界。开源。智谱将在发布两周后开放模型权重,此前完成安全评估与模型加固。

8. 智谱发布GLM-5.3,编程能力提升50%,两周后开源权重

9. 刚刚,GLM-5.3来了,拿下多个开源SOTA,我用它“魔改”DeepSeek Harness

10. 智谱发布GLM-5.3:编程能力最强开源模型

11. 智谱发布GLM-5.3 公司称是编程能力最强的开源模型

12. 智谱GLM-5.3大模型发布:开源中最强、编程/智能体性能接近Fable 5

13. 智谱发布GLM-5.3,编程与网络安全能力大升级

14. 智谱发布 GLM-5.3:编程能力最强开源模型

15. Z.ai发布GLM-5.3:后训练驱动性能飞跃,两周后开源

16. 智谱发布GLM-5.3:不换底座编程提升50%,登顶开源编程榜

17. 智谱(02513)正式发布GLM-5.3 编程能力稳居开源榜首

18. 智谱发布GLM 5.3:称“编程能力最强的开源模型”,接近Fable 5

19. 史诗级逆袭!GLM-5.3暴力升级,编程能力暴涨50%硬刚OpenAI克劳德

20. 智谱GLM-5.3开源倒计时:编程能力暴涨50%,开源天花板被捅破

21. 智谱正式发布GLM-5.3 拥有更强编程能力

22. 智谱正式发布GLM-5.3,拥有更强编程能力

23. 智谱发GLM-5.3, 743B基座死磕网安 智谱今天把 GLM-5.3 给端出来了, 目前没有开放权重, 最近大家都在卷底层防御系统 官方说是基于 743B 的超大底座 post-training 出来的; 核心不仅是代码 Agent 能力提升, 更离谱的是在 CyberGym 这种极度硬核的网络攻防测试里拿了 84.5 的高分; 然后就是效率问题, 看了眼图表, 它花更少的输出 token 反而拿到了比 Fable 5 更高的代码准确率, 算是把思考过程里的废话给砍干净了. 不过因为网安攻防能力太顶, 官方没敢直接放权重, 还在搞严格的安全评估, 目前只能在 ZCode 和 Coding Plan 里玩. 估计是被前阵子 Claude 被强制断供的事搞怕了, 开源大厂现在发大招也变得畏手畏脚了 #GLM# #智谱# #GLM53# #Agent# #网络安全# #开源模型#

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章