智谱GLM-5.3-FlashX上线,速度追平DeepSeek但价格涨了2.5倍
源自230位全网作者
16:50
精选参考来源
1
智谱用 GLM-5.3 自己优化了自己的推理系统智谱今天披露,GLM-5.3-Flash 的全部生产推理已运行在超过 10 万块国产 AI 加速器上。从模型首次跑通到上线生产,不到两周,端到端吞吐量提升了 3.2 倍。完成大量优化工作的不是工程师团队,而是一个由 GLM-5.3 驱动的 AI 智能体。智谱 CEO 唐杰发推说,他反复想的一件事是:干活的主力是模型自己。一个模型在帮忙优化运行它自己的系统。部署条件很苛刻。国产加速器显存容量和带宽有限,软件生态不成熟,很多该有文档的地方只能靠猜。GLM-5.3-Flash 还要支持 100 万 token 上下文和多模态请求。每一步优化都是在做交换:用计算换显存(ReplaySSM),用通信换显存(节点内张量并行),用精度换容量(INT8/FP8/BF16 混合缓存),用架构分离换调度自由度(编码-预填充-解码分离)。最终国产芯片的单 token 成本对标了主流英伟达 GPU。但唐杰说,最重要的经验不在任何一个具体优化上。智能体卡住的时候,几乎从来不是因为它写不出代码,而是因为它不知道事情为什么变差了。"吞吐量下降了 20%"告诉你出了问题,但不告诉你问题在哪一层、该验证什么假设、下一步该测什么。用强化学习的话说,这是一个稀疏奖励加信用分配的问题。而一次端到端基准测试要跑好几个小时,试错成本极高。资深工程师能定位问题,靠的是脑子里一套隐性的"过程奖励"——知道什么时候该看执行时间线,什么时候该跑微基准测试,该对比哪一层的输出。智谱做的事情是把这套隐性经验显性化,他们叫"密集反馈":构建一套分层验证接口让智能体直接调用。正确性反馈回答"算对了吗",系统行为反馈回答"时间花在了哪",性能反馈回答"哪个方案在什么条件下更优"。每类信号都要求足够局部、获取成本低、可客观验证。靠这套机制,智能体发现并修复了三个真实的工程问题。第一个是精度漂移。KDA 内核在上下文并行路径中,TF32 的舍入误差通过链式状态矩阵合并不断累积,上下文越长漂移越大。修复已合并到开源项目 Flash Linear Attention。第二个是并发瓶颈。KV 缓存传输本该和计算并行,但智能体发现两者从未重叠。它沿调用链追到 Python 和 C++ 的边界,发现 DeepEP 的节点内路径没有释放全局解释器锁(GIL),传输线程一直拿不到执行权。修复后开销从超 30% 降到 1% 以下。第三个是重复计算。一个解码内核因分块方式把同一归一化运算重复做了四遍。智能体重组了计算结构,加速 1.71 倍。优化思路来自它阅读 SGLang、FLA、DeepGEMM 等项目的内核代码后提炼出的"优化骨架"。唐杰强调了边界:目标设定、反馈环境搭建、高风险变更审查仍然由人负责。但工程师的角色正在变化——从解决问题的人,变成设计反馈的人。他还指出一层更深的含义:一个建立在真实基础设施任务上的分层可验证反馈环境,恰恰是训练下一代模型最需要的东西。智能体完成的每一个任务,都可以成为它后继者的训练素材。唐杰说:“我们离递归自我改进还很远,但最小的闭环已经存在了。模型优化系统,系统运行模型。”有兴趣可以看看他们官方的文章:《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》网页链接
2
国产大模型开始调国产AI大芯片,反哺了属于是智谱唐杰写了篇RSI 递归自我改进实践的文章,这两天 DeepSeek 算子工程师把才华埋葬在昨天的推文也火遍全网,总结两篇文章中的核心意思,可以看见正在发生一场底层算力变革:大模型化身基础设施 Agent,改写AI国产芯片的使用逻辑。唐杰披露,GLM-5.3 驱动的 Infra Agent 仅用两周,就让 GLM-5.3-Flash 在国产加速卡从跑通到承接全量线上流量,端到端吞吐提升 3.2 倍。国产卡普遍受限于显存、互联带宽不足,算子残缺、文档匮乏。Agent 搞定 KDA 精度漂移,把 KV 传输开销从 30% 压至 1% 以内,重构 Decode 算子实现 1.71 倍加速。它依托稠密反馈机制,把顶尖工程师隐性调优经验拆成正确性、系统行为、性能三类可验证反馈,靠以算换存、通信换显存等资源置换榨干硬件潜力。Agent 每一次调优都会产生训练信号,形成 AI 递归自我改进的早期闭环。DeepSeek 算子工程师则感慨:AI 算子能力快速追上顶尖工程师,手工写底层算子的价值持续下滑。工程师不再手写内核,转向设定约束、校验 AI 输出。两套视角共同指向新范式:国产算力不再高度依赖稀缺算子工程师手工补软件栈,AI Infra Agent 成为自动适配引擎,大幅缩短芯片落地周期,拉高硬件利用率。国产大模型和国产AI大芯片,双向奔赴。在国产AI大芯片上跑的大模型,反过来帮助大芯片更好使用。两者一起摆脱美制大模型+英伟达芯片的格局。#华为发布全新AI计算架构##小米大模型每小时烧钱超20万##小米直播训练大模型#
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹