智谱GLM-5的公开,标志着开源AI正式迈入长任务时代。其背后论文详尽揭示了三大关键技术:动态稀疏注意力、异步强化学习和真实世界数据投喂,有效解决了模型在复杂软件工程中的算力成本与真实环境适应性问题,为开源社区带来了极具价值的技术突破。
智能速览
GLM-5能连续运行代码超24小时,自主构建GBA模拟器。
引入动态稀疏注意力机制,极大降低长上下文推理成本。
自研异步强化学习框架,将训练效率提升5倍。
投喂真实世界可验证数据,提升模型工程能力。
在SWE-bench等关键评测中达到开源模型最佳水平。
精华内容
GLM-5的实现并非一日之功,其背后是对现有技术瓶颈的精准打击。接下来,深入剖析其三大核心技术,看看它如何为开源AI注入长任务处理能力。
降本增效
面对Transformer架构传统密集注意力计算复杂度随上下文长度呈平方级增长的瓶颈,GLM-5引入了动态稀疏注意力机制(DSA)。它通过动态的细粒度选择机制替代传统的密集注意力,审视内容并动态决定哪些Token是重要的,从而有效降低了计算成本。
为避免直接训练DSA模型带来的梯度爆炸或模型崩塌风险,团队采取了巧妙的继续预训练策略。数据显示,这一方法效果显著:在200K上下文长度下,解码延迟降低了73%;在1M上下文长度下,吞吐量提升了3.5倍。
效率革命
为解决主流强化学习对齐算法PPO因同步机制导致的GPU利用率低下问题(仅20%-30%),GLM-5重写了一套异步强化学习基础设施。其核心是将训练引擎和推理引擎解耦到不同GPU设备,推理引擎持续生成轨迹,训练引擎异步更新模型,显著提升了资源利用率。
这套系统还包含三大关键技术:Token-in-Token-out(TITO)替代文本输入输出,保证了轨迹精度;直接双侧重要性采样解决了离策略偏差;DP感知路由则加速了长上下文推理。最终,该框架将GPU利用率提升至75%,整体训练效率提高了5倍。
实战演练
传统SFT数据往往依赖标准答案,难以让模型应对真实世界的复杂多变。为此,GLM-5的第三板斧是构建了大量可验证的真实世界环境数据。
其SFT语料库涵盖通用对话、推理、编程与Agent三大类别,最大上下文长度扩展至202752个token,并支持多种思考特征。此外,团队还构建了大规模可执行环境用于Agent RL训练,数据源包括Codeforces、TACO等代表性数据集,让模型在实战中学习真正的工程能力。
实力验证
GLM-5在多个关键评测中展现出强劲实力。在SWE-bench Verified上得分77.8%,成为开源SOTA模型,优于Gemini 3 Pro,并与Claude Opus 4.5相当。在HLE测试中得分50.4,同样优于Claude Opus 4.5和Gemini 3 Pro。
团队认为传统评测已不够看,因此推出了更贴近真实开发的CC-Bench-V2评测集。结果显示,GLM-5在前端构建成功率上达到98.0%,后端Pass@1达到25.8%,但在长程任务上与顶尖模型仍有差距。此前,GLM-5曾以“Pony Alpha”代号匿名发布,凭实力引发社区轰动,证明了其技术水准已获得国际认可。
GLM-5的公开不仅是技术上的胜利,更是开源社区的一次重要赋能。它证明了国产模型有能力在复杂长任务领域与顶尖模型一较高下,其技术细节为后续研究提供了宝贵参考。未来,如何进一步突破长程任务中的错误累积,将是更值得期待的挑战。