算力够了,显存先满了:大模型推理从“堆GPU”转向“存算协同”,这三笔账和你有关

源自41位全网作者

02:29

8月28日的中国国际大数据产业博览会上,中科曙光发布了一个叫 ParaCache 的"词元加速方案"。知乎 界面新闻给这条新闻的标题起得很直白:大模型推理遇到瓶颈,行业正从"堆GPU"走向"存算协同"。界面新闻

乍看这是厂商发新品,不值一提。但如果你这半年同时有过三个体验——模型 API 明面上一路降价,可你丢进去一篇十万字长文,首字要等十几秒;手里24G显存的卡,标称"能跑"的模型一上长上下文就 OOM;你查内存和SSD价格,发现只涨不跌——那这条新闻恰好把三件事的同一个病根说清了:卡脖子的不再是算力,是记忆。界面新闻

一、KV Cache:从加速器变成"大冤种"

大模型每吐一个新 token,都要回头"看一遍"前面的上下文。为了不用每步重算历史,推理引擎会把已算好的 Key/Value 向量存下来复用——这就是 KV Cache,可以理解成模型的"草稿本"。PagedAttention 解决的是草稿本乱涂乱放(显存碎片),FlashAttention 省的是翻本子的力气(访存)。知乎 但草稿本有个魔鬼属性:上下文越长、对话轮数越多、并发用户越多,它就越厚,而且默认必须放在最快也最贵的 GPU HBM 里。

问题来了:模型权重、激活值都在抢 HBM,草稿本越写越厚,显存先被占满。更要命的是,传统 KV Cache 只活在单次对话、单张卡、单个节点里。知乎 企业场景里,成千上万请求共用同一套系统提示词、同一个知识库,前面那一大截公共上下文的 KV 被算了一遍又一遍——GPU 算力在干重复劳动,显存在存重复垃圾。

二、“以存换算”:把用完即弃的草稿,变成全集群的长期记忆

ParaCache 的思路不是把草稿本变大,而是把它搬走、共享起来:打通 GPU HBM、CPU DRAM、本地/集中式 SSD、分布式存储四级缓存,热的留在显存,温的下放内存,冷的进 SSD,最后垫一层分布式共享池;同时做全局元数据管理,让一份算好的 KV Cache 跨请求、跨 GPU、跨节点复用——翻译过来就是:同一道题只算一次,谁用谁取,不必重算界面新闻 它还原生兼容 LMCache 开源生态,企业不用推倒现有推理栈。知乎

厂商给了一串测试数据:高并发场景 token 吞吐最高提升 27 倍;120K 输入下,单轮对话首 token 时延(TTFT)最高降 98.5%、降到 400 毫秒;多轮会话 TTFT 降超 80%;某银行信用卡中心客服吞吐约 3 倍、某教科研知识库并发 15-20 倍;内存与 SSD 采购省约三分之一。知乎界面新闻 这些数字目前全部出自曙光自测,没有第三方复现,看的人先按"方向性证据"处理。

但注意,曙光自己的产品经理也说得很清楚:这套东西吃的是"长上下文占比高、公共重复上下文多、并发压力大"的场景——一次性短请求,复用价值有限界面新闻 所以 27 倍这种数字的正确打开方式是:它是特定工况的天花板,不是平均值。

三、它为什么偏偏是现在:一个和存储涨价对着干的循环

把这件事当纯新品看会低估它。根据 TrendForce 的预计,2026 年三季度 DRAM 合约价环比还要涨 13%-18%,NAND Flash 涨 10%-15%——AI 把存储需求推上去,存储涨价又反过来抬高推理成本,推理成本倒逼出"以存换算",这个鸡生蛋的循环才是存算协同被推到台前的真实原因:既然内存买不起也等不到降价,那就把每一 GB 内存的复用率榨到极致,用便宜的分布式存储替昂贵的大内存扛量。知乎

社区的风向也在同一时间靠拢。知乎上"大模型真正的斩杀线是什么"的问题下,被顶到前面的回答说法是"算力,没有算力做啥都白搭"。知乎 MiniMax 闫俊杰 8 月 28 日提出"最小化推理成本,最大化智能",同样指向成本这条线。知乎 前脚发布的 GLM-5.3-Flash,被 226 万浏览的讨论盯上的点恰恰是"能力到前沿、推理成本大幅下降"。知乎 价格战的表象下面,下半场比的东西已经换了名字:不是谁卖得便宜,是谁的单 token 成本结构更优。

四、三拨人分别怎么算这笔账

还在为账单纠结的 API 用户:别只盯着挂牌单价。缓存命中、长上下文的计费方式、TTFT 的实际体感,比"再降 20%"的标题更值得看——如果"以存换算"从机房卷到计费页,"命中缓存打折"会从技术细节变成卖点,那才是新一轮降价的真正信号。

自己折腾本地的硬件党:这波趋势替你回答了老问题——为什么跑长文本时显存容量比算力更决定生死。知乎 统一内存的 Mac 在这件事上意外吃香(内存带宽大、KV 放得下),把 KV 卸载到内存/SSD 的本地工具也因此越来越被翻出来——小红书上"140多个star的逆天神器 oMLX"被做成教程,评论区全是"生态要起飞了"。小红书 顺带一提,还有人在动"让草稿本本身变小"的路线:知乎上有团队晒出用固定状态替代 KV Cache、把 100 万 token 的"记忆包袱"从 3GB 压到 0.381MB 的实验,但也诚实承认语言质量还输给 Transformer 约 11%(自报数据,待复现)。知乎 系统层复用和架构层压缩,是两条会长期并行的省钱路。

打算卷 AI Infra 的人:秋招市场的信号已经先到了——B站上"算子开发、推理框架与芯片适配"的简历规划视频开始有人专门做。哔哩哔哩 注意力机制的优化相对收敛之后,显存管理、缓存调度、分布式存储这些原来偏"底座"的活正在变成推理优化的主战场,学习投入往这边挪不吃亏。

五、接下来盯什么

判断"存算协同"是一家厂商的故事还是行业风向,看四个信号就够了:vLLM、LMCache 这些开源引擎是否把集群级 KV 复用做成默认能力;下一季度内存合约价是否松动(那是所有降本方案的对照组);API 厂商是否开始把缓存命中率写进价格表;以及数博会之后,有没有第二家、第三家大厂跟进同样的发布。算力堆不出来的部分,正在被"存得聪明"补上——“管好记忆正在变得和提升算力同等重要”,这句话目前还是厂商说的,但把它变成现实的,是每个人的账单和整条内存的价格曲线。界面新闻

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章