AI训练跑不满GPU?90%的瓶颈不在算力,而在“存储墙”和“带宽墙”

源自163位全网作者

05-26 12:37

内容由AI生成

精选参考来源

1. 最火芯片研究机构! SemiAnalysis创始人:算力瓶颈从CoWoS转移到EUV,存储吃掉30%资本开支

2. AI救活了一家马桶公司,也点燃了存储芯片超级周期【硅谷101】

3. Nvidia花200亿买Groq,是GPU推理真到瓶颈了还是单纯消灭对手?

4. 为什么 AI 需要 GPU 和 TPU:理解大语言模型背后的硬件

5. 100根内存条换一套房!AI疯狂吞噬全球内存,普通人电脑快买不起了

6. Alluxio AI——构建面向具身智能数据闭环的高性能数据访问平台

7. 谷歌一篇论文引爆存储芯片崩盘!AI内存需求暴降6倍,推理狂飙8倍

8. “HBM之父”:高带宽闪存(HBF)商业化进程超预期,或将在2-3年内集成到GPU,市场规模将超HBM

9. DeepSeek新论文来了!联手清华、北大,优化智能体大模型推理

10. 谷歌TurboQuant会绕过“内存墙”?这个判断有点过了|甲子光年

11. 从算力到存储,谁能掌握AI时代的“口粮”? #大咖观察 #红衣聊AI #算力 #存储 #硬件

12. 将 600 亿参数大模型装进手机的瓶颈,终于被中国 AI 公司突破了

13. 谷歌论文,干崩存储?#谷歌 #存储芯片 #Google #Deepseek #AI推理

14. 计算所严明玉团队新作: Attention 并非永远是瓶颈,多 GPU 并不一定更快

15. 【推理计算的真正瓶颈已经转移:从芯片问题变成系统问题】NVIDIA在CES发布的Rubin架构规格引发了一场关于AI推理未来的深度讨论。+ 核心数据揭示的趋势Rubin的关键参数耐人寻味:- 每GPU的scale-out带宽达到1.6 TB/s- 72个GPU可作为单一NVLink域协同工作- HBM容量仅提升1.5倍,但带宽提升2.8倍,算力提升5倍这组数据传递的信号非常明确:算力增长速度远超内存容量增长。这意味着我们无法再简单地“加载更大的模型”然后静态推理,而必须利用超高带宽动态调度和交换数据。+ 业界的深度解读有从业者指出,这一趋势其实早已显现。大模型推理性能受限于内存带宽和互联带宽。具体而言:1. 分布式KV缓存成为刚需:当前的Agent工作负载中,大量请求使用相同的长上下文窗口。单节点处理效率低下,必须采用分布式KV缓存,这正是NVIDIA推出Inference Context Memory Storage平台的原因。2. 高批量处理的网络挑战:为最大化吞吐量需要运行超大batch size,这要求将模型切分到多节点,节点间需要极快的互联。3. Prefill与Decode的分离趋势:Prefill阶段计算密集且高度并行,Decode阶段则受内存带宽限制。Rubin CPX的设计正是针对这一点——移除昂贵的HBM,堆叠更多算力专门处理Prefill。实践中可以将两个阶段拆分到不同集群,根据用户工作负载动态调整资源分配。+ 历史视角与生态变化有人提醒,总线和网络作为瓶颈并非新鲜事——从大型机时代就是如此。每一代互联技术更新后瓶颈会暂时缓解,直到其他组件再次超越容量上限。值得注意的是,NVIDIA也在发布交换芯片,对于NVLink后端网络,他们通过销售完整机架系统将占据大量市场份额。+ 核心洞察黄仁勋的话点明了方向:“未来是在推理链的每一步协调多个优秀模型。”这意味着从“静态推理”到“系统编排”的范式转变。如果软件栈不是为这种编排而生,再强大的Rubin集群也不过是昂贵的暖气机。

16. 存储产能根本跟不上!美光警告:缺货将持续至2026年后

17. 英伟达推理上下文内存存储对NAND意味着什么?

18. #存储价格上涨原因##内存条价格涨幅远超金条# 2025下半年起,存储芯片开启暴涨模式,DDR5内存条涨幅超300%,DDR4超150%,日涨40元成常态,行情超越2018年高点,“超级牛市”已然来临。本轮涨价核心是AI算力需求的结构性爆发:AI服务器内存需求量是普通服务器的8-10倍,消耗全球53%内存月产能,海量高端需求挤压消费级产能,叠加头部厂商收缩成熟制程,供需缺口持续扩大。涨价潮已沿产业链传导,PC、手机终端纷纷提价500-1500元,存储在整机成本占比飙升至30%以上。机构预测2026年涨价将贯穿全年,一季度涨幅或达40%-50%。这不仅是短期周期反弹,更是AI时代存储架构的重构。终端厂商需优化供应链策略,国产存储企业则迎来替代窗口期,唯有技术突破与产能扩容并举,才能在行业变局中把握先机。#秒懂热点就用智搜# 存储价格上涨原因

19. 【GPU霸权将被超大内存架构取代,AI芯片迎来内存革命!】AI芯片的技术演进正站在重大拐点之上 。被誉为“HBM之父”的韩国科学技术院电气与电子工程学院教授金正浩近日公开表示,未来AI算力体系将发生结构性重构——主导权正从处理器转向内存 。目前以英伟达GPU和通用CPU为核心的计算范式,将在中长期被一种全新的内存中心化架构所替代 。在这种新架构中,高带宽内存(如HBM)与前沿封装内存(如HBF)不再只是辅助组件,而是整个系统的基石与数据枢纽;而CPU、GPU甚至专用AI加速器,则将作为可插拔、低延迟嵌入式的计算单元,深度集成于内存子系统之中 。这一转变不仅关乎性能跃升,更将重塑芯片设计逻辑、系统互联方式与产业竞争格局 。#烈焰童子说#

20. 面向大模型推理的模型与系统协同优化

21. 开启存储下一个大机会!韩媒详解黄仁勋“神秘推理上下文内存平台”

22. 英特尔掌门人警告:AI内存危机彻底爆发! 别再盯着算力了,这才是真卡点。#大咖观察 #红衣聊AI #内存 #算力 #英特尔

23. 昨天存储芯片都跌,都说谷歌发布了一个TQ算法论文,把缓存利用率大幅提升了,存储危险了。是怎么回事呢。这么说吧,AI大模型推理的时候,要记住你之前的对话,就会把记忆存在KV缓存里面,你聊天回合越多,存的记忆就越多。TQ算法什么创新呢,它完全不改模型,不用重新训练,就能把KV缓存的内存占用压缩至少6倍。有了它,再H100 GPU上注意力计算能提升8倍,还不影响模型精度。真的太香了。所以市场一顿跌,算法改进对存储的利用率一下子提高那么多,那存储需要那么多吗,都在担心这个事儿。其实没必要,毕竟这个只是针对缓存,还没针对硬盘,HBM。不过话说回来,既然现在有TQ算法,将来会不会有什么XX算法,把其他领域的存储利用率大幅提升呢?完全是有这个可能的嘛!存储也不要指望一直这么赚钱,太贵的东西,别人研发优化算法的意愿就很强烈。两者互相对冲。

24. AI下一个风口:存储!中国早站在顶端,就等超车时刻!

25. 离谱:256G内存比RTX5090还贵,你要为AI买单吗?

26. #DeepSeek下个王炸是什么#DeepSeek在去年春节炸场,这几天AI圈又在等它“过年”。2026年才开始不到两个月,DeepSeek已经连续更新四次,这种高频迭代不像是常规小修小补,更像是新一代旗舰模型更新前的最后冲刺 。这次的技术明牌了,mHC(流形约束超连接)和Engram(条件记忆) 。mHC解决的是“芯片墙”问题,通过优化层间信息流动来对冲国产芯片在互联带宽上的短板;Engram则是打破“内存墙”,把静态知识存进便宜的DRAM,把昂贵的HBM留给动态计算 。在算力受限的现实约束下,用架构创新把能效比压榨到极致。至于V4,业界普遍预期它不会继续卷参数,而是走“极致效率+垂直穿透”的路线。编程能力据说已经对齐甚至超越Claude和GPT系,百万级上下文也基本实锤 。现在的悬念是:DeepSeek这发子弹打出去,会不会再次把Token成本打下来,催生出一波真正的AI原生应用? #HOW I AI#

27. 超DeepEP两倍!无问芯穹FUSCO以「空中变阵」突破MoE通信瓶颈,专为Agent爆发设计

28. 中国突破1纳米铁电芯片技术!全球最小栅长+超低功耗 。据报道,北大团队研制出全球首款1纳米栅长铁电晶体管,三大突破或将改写芯片历史: • 性能颠覆:工作电压仅0.6V,能耗较传统芯片降低百倍,纳秒级完成数据翻转 • 结构革命:首次实现存储与逻辑单元同电压直接交互,破解"冯诺依曼瓶颈" • 能效跃升:数据搬运能耗占比从60%降至趋零,同步解决"存储墙"与"能耗墙" 这项技术标志着硅基芯片物理极限被突破,铁电材料二维化更开启后摩尔时代。国产芯片正以"存储计算一体化"的创新架构,为AI、高性能计算提供全新解决方案。

29. 由于昇腾910B芯片的硬件设计限制,包括显存容量显著低于H200芯片(64G Vs 141G),显存带宽差2倍(1.6TB/s Vs 4.8TB/s )等,(H200是英伟达的中等配置芯片),这些限制导致在新模型训练过程中遇到很大的困难。纯纯废铁。

30. 为什么英伟达的显卡显存都没办法做大?

31. 内存涨价凶猛,业内人士形容「内存条一盒堪比上海一套房」,为什么内存条越来越贵?还会持续涨价吗?

32. 一步到位!存储涨价潮下的装机首选:铠侠 VC10 PCIe 5.0 固态硬盘实测

33. 8G 显存逆天了!竟能跑 35B AI 大模型!多模态 + N/A/Intel 全适配,附最新部署教程!|零度解说

34. 双卡 48G 显存!最省钱的多卡大显存选择 Arc Pro B60

35. 存储涨价之后,如何让AI走向数据?丨ToB产业观察

36. 给大家说一个新东西:HBF(High Bandwidth Flash,高带宽闪存)。这东西为什么冒出来?一句话——推理太贵了。现在做 AI 的都知道,HBM 是标配。比如 NVIDIA 的 H100、B200 这一类卡,核心旁边堆着 HBM,带宽极高,专门解决“内存喂不饱算力”的问题。没有它,大模型根本跑不动。但问题也很明显:HBM 贵,而且容量上不去。你想在一台机器上多跑几个模型,或者挂一个超大模型,显存很快就顶满,成本更是夸张。于是存储厂商开始推一个新方向:HBF。简单理解,就是把 3D NAND 往“更高带宽、更近封装”方向改造,试图卡在 HBM 和传统 SSD 之间,做一个中间层。现在在积极推动这个方向的,基本都是存储大厂:三星,海力士,镁光,闪迪他们的逻辑也很清晰:未来 AI 不只是训练,而是大规模推理。推理拼的是成本、功耗和容量。如果什么都靠 HBM,容量上不去,而且也来不及生产。所以市场急需一个东西——比 SSD 快很多,但比 HBM 便宜很多。HBF 就是在这个背景下被推到台前的。它不会取代 HBM。HBM 还是算力核心的“心脏”。但在超大规模推理集群、或者端侧模型场景里,确实可能成为一个缓冲层,让更多模型能“装得下、跑得起”。如果说前两年是“拼训练规模”的时代,那么现在明显进入“拼推理成本”的阶段了。这一波如果启动了,模型的推理成本可能大降,以后大家养虾自由就不是梦了。。

37. AI数据中心GPU大规模闲置|显卡日报5月5日

38. “这很难,但我相信你们”!黄仁勋上周宴请SK海力士工程师,亲自敬酒,敦促“无延迟交付HBM4”

39. 拿下1亿美元种子轮!SGLang团队创立RadixArk,打造下一代开放AI基础设施

40. 狙击推理时代!英伟达200亿美元收购Groq,能否巩固AI帝国护城河?

41. 英伟达为何持续押注VASTData?AI存储正在成为新的“算力”|甲子光年

42. 推理需求暴增,SRAM 如何解决 GPU 不够用的问题?

43. 据SemiAnalysis报告,NVIDIA已下调下一代Rubin架构GPU配套HBM4显存的性能目标,主因在于SK海力士与三星难以在量产阶段达成原定激进带宽指标。原计划Vera Rubin系统的总显存带宽目标为22TB/s,但受限于良率与技术瓶颈,首批出货系统预计仅能实现约20TB/s,对应的HBM4每针速率约为10Gbps。回顾过往,NVIDIA曾多次调整VR200 NVL72系统的带宽目标,2025年3月目标为13TB/s,同年9月提升至20.5TB/s,2026年CES上确认为22TB/s,并以此作为压制AMD Instinct MI455X(19.6 TB/s)的关键核心亮点。不过随着量产压力显现,NVIDIA不得不接受约20TB/s的实际部署表现,这意味着其领先对手的幅度将大幅收窄。

44. AI浪潮正驱动NAND Flash存储需求呈结构性激增,群联CEO潘健成表示,目前群联仅能满足客户30%的需求。潘健成直言,目前高达七成的缺口无法应付,群联在这波存储缺货大涨价的浪潮下,营运会持续向上。潘健成分析称,这波存储超级循环与过往消费性电子景气循环不同,这波存储市况大好主要由AI数据中心建置与应用导入驱动,呈现结构性成长。AI崛起让数据量快速累积,企业对高容量与高效能储存需求同步攀升,带动NAND芯片价格上涨,DRAM供应更成为关键瓶颈。他还强调没有内存就没有AI,在高容量内存需求快速增加下,若供给无法跟上,将直接限制AI系统发展。从价格面来看,潘健成表示,内存价格一直涨,反映供需失衡现况,三星、SK海力士等大厂短期内难以快速扩产填补供应缺口,使得价格具支撑。#金价八连跌抄底大军越买越跌#

45. 涨得比黄金猛,为什么内存条原地起飞?AI看得上我这200块破内存?【柴知道】

46. 【Z-Image 详细测评】超高质感 符合亚洲人审美 最新开源生图模型 6GB显存可用

47. 你爆过显存吗?爆显存的实际表现到底是怎样的呢,其中是什么原理

48. 爆火的 Z-Image 模型!8G 显存能跑,无内容审查、支持NFWS、超高速,本地部署教程!支持(Win/Mac)| 零度解说

49. 手机电脑内存价格暴涨的主要原因,还是AI算力需求爆发导致存储产能结构性失衡。全球数据中心和高性能计算对HBM(高带宽内存)的需求激增,促使大厂将产能优先转向利润更高的HBM及服务器用DRAM,造成消费级DRAM和NAND闪存供应大幅缩减,再叠加厂商库存普遍偏低、经销商囤货惜售等因素,进一步加剧了市场供需失衡,价格水涨船高,短时间之变不了。

50. Pcie6.0正式量产,28G/s超快速度,性能直接翻倍

51. #内存条单日闪崩一百多元# 值得注意的是,AI对内存的影响是结构性的。新技术主要降低推理缓存需求,不影响训练与HBM,长期看成本下降或刺激更多AI应用,反而可能抬升总需求。AI带来的技术迭代会持续影响内存市场,价格波动会更频繁。

52. GPU计算中的Memory Wall(内存墙)是什么?

53. “内存墙”而非“存储墙”

54. 内存墙与优化技术解析

55. 大模型时代两大痛点:内存墙和计算精度

56. 从 imec 报告看 AI 硬件瓶颈

57. 速读顶会论文

58. 存储墙越筑越高

59. HBM的内存墙

60. xAI 55万张GPU利用率仅11%,AI行业效率黑洞有多深?

61. 你的 GPU 为什么在摸鱼?——存储金字塔、带宽瓶颈与 Roofline 模型

62. 前谷歌TPU架构师

63. 内存带宽开始决定推理上限,GPU路径正在逼近边界

64. 根治AI算力“内存墙”,GPU-HBM光互连要来了?

65. 调研解读|“内存墙”

66. 打破“内存墙”

67. AI 算力已进入 “系统为王”时代

68. 大模型分布式训练/推理网络性能调优指南

69. 案例分享|Salesforce 借助 DDN 与 Google Cloud 大幅提高GPU利用率

70. 如果内存容量低于显存容量,在深度学习计算中会有什么影响?

71. 独立 GPU 的内存类型与访问特性

72. 三台4090服务器GPU全部PCIe降级到1.0——排查实录

73. “存力”已成AI算力背后的“隐形瓶颈”

74. AI算力继续扩张,但瓶颈已从算力本身转向数据路径与存储体系

75. 突破 AI 基础设施的 I/O 墙

76. 为什么 HBM 要紧紧贴在 GPU 旁边?

77. 三星

78. HBM DRAM

79. AI对内存永无止境的需求

80. 理解 HBM,不能只把它当成一种更贵的内存

81. 端侧大模型上车,统一内存架构如何敲碎“访存墙”?

82. AI Infra高效运维(六)

83. PCIe、NVLink、CXL……谁才是芯片互联界的“真·海王”?

84. NVlink为什么那么快?你知道PCIe和NVlink的区别吗?

85. 英伟达NVLink故障

86. 原来内存比算力更加卡脖子?人工智能与内存墙

87. GPU 空转别怨卡!服务器内存配置,才是深度学习效率的关键

88. 带宽没有不够,是“离得太远”开始主导GPU性能

89. 内存技术

90. 美光

91. AI内存瓶颈突围

92. AI真正的瓶颈,不在算力,而在内存与存储

93. 为什么说HBM是AI军备竞赛背后的“核反应堆”?

94. 突破内存瓶颈

95. 适合Transformer模型训练的GPU显存容量选择指南

96. 大模型训练GPU选型决策框架

97. GPU算力选型策略

98. 算力破局

99. 2026实测

100. 梁博谈一谈

101. Apple Silicon 炸场!Wasm WebGPU Zero-Copy 让大模型推理内存拷贝归零,延迟暴降 60%

102. openYuanrong 数据系统

103. 大模型分布式训练

104. 百人AI谈#47-关于Memory Bound

105. 智领AI未来

106. 存算一体芯片来了!颠覆传统存储架构,AI 训练速度提升 10 倍

107. NPU内存墙

108. 内存墙终极解法

109. AI 算力空转?NVMe 多盘全闪出手,一键破解存储瓶颈

110. 突破内存墙

111. GPU利用率低于15%

112. 软硬协同设计的大模型推理发展现状与预测

113. 选择GPU服务器时,显存容量还是显存带宽更重要?

114. 从训练同步到推理服务,AI网络架构的核心挑战与选型指南

115. 火山引擎正式上线 102.4T 自研交换机,构建 AI 网络新底座

116. 【机构研报】半导体行业

117. InfiniBand深度解析

118. 技术演进视角——显存位宽与带宽的升级路径及影响

119. 🔥 HBM4黑科技全解密 | 2026 AI内存革命已来!

120. 英特尔亮剑HB3DM

121. 内存芯片厂商集体开卷“廉价版”HBM4!

122. 笔记 -HBM(高带宽内存),储存芯片

123. HBM存储产业链全解析

124. HBM4和3D DRAM,将打破内存墙?

125. 一文读懂HBM

126. 2026年HBM内存技术路线图与产业链关键供应商介绍

127. AI时代,存储为王:瓶颈突破与投资机遇全景解析

128. AI算力项目实践 | GPU利用率不高,存储IO饿死GPU了

129. AI算力项目实践 | GPU利用率不到40%,不是卡不行,是存储IO饿死GPU了

130. AI大模型训练的存储革命:RustFS如何实现10倍性能提升?

131. 1994年CPU撞上的墙,2026年GPU又撞上了

132. GPU 互联革新:NVSwitch 高速全互联技术深度解析

133. AI芯片利用率低?其实是存储系统的问题

134. AI 训练集群升级时,底层闪存架构还能做些什么?铠侠第八代 BiCS 闪存带来新可能

135. 长文本推理的“内存墙”:GPU 算力的终极梦魇

136. HBM4与BlueField-4携手突破内存墙

137. NVSwitch生态演进、软件栈解析与国产化路径展望

138. 为什么AI训练应选择HBM,DRAM不行吗

139. 突破"内存墙"新方案:光互联进入GPU-HBM封装

140. AI时代需要什么样的存储

141. 破解AI超节点 “内存墙”:内存池化技术如何让千亿模型训练效率倍增?

142. AI I/O墙:美光PCIe Gen6存储

143. 破解存储墙 HBM迈向光互连GPU!

144. 不是硬盘不够用!AI存储真正的坑:性能、成本、安全的三角困局

145. CXL方案优化AI存储架构,头部厂商有望加速应用-东方证券

146. Infortrend GS 5024智能全闪存储:为AI训练提供高效平台

147. 打破“内存墙”,GPU 与 HBM 间的“光互连”正在崛起?

148. 万卡集群的”神经系统”:AI智算中心网络架构的5层蛋糕与选型实战

149. AI硬件核心产业链(带宽+存储)分析

150. Linux 6.19/7.0-rc1 对 GPU 互联 / 通信的核心支持

151. 1.8TB/s 带宽 + 1.5 微秒延迟!NVLink 让双 GPU 性能狂飙

152. HBM高宽带行业专题研究

153. 67%理论最大并行率,NVENC变身PCIe带宽倍增器

154. 别老盯着GPU了,真正把AI“喂饱”的那根水管叫HBM(高带宽内存)

155. 300万奖金AI存储难题!华为第六届奥林帕斯奖启动,瞄准Agentic AI时代核心瓶颈

156. AI驱动下的DRAM技术极限与演进路径

157. 大模型硬件入门指南:从显存计算到实战选型全解析

158. 软硬协同优化,英特尔+阿里云打造AI普惠算力底座 - 哔哩哔哩

159. AI大模型训练成本怎么降?这样打造更稳的存储层

160. M5 MacBook Pro 48GB 内存跑 Ollama,GPU 100% 后直接卡死

161. GPU服务器内存配置黄金法则:从入门到精通

162. 为什么内存墙问题越来越严重?

163. read() 每调一次就穿越一次内核——mmap 如何用页表映射把 100GB 文件变成内存数组

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章