花几亿买GPU却被这张网卡脖子:AI算力军备竞赛最隐蔽的胜负手

源自66位全网作者

07-12 12:44

内容由AI生成

精选参考来源

1. 通信技术:AI算力升级的新瓶颈与破局之道

2. 当万卡GPU集群遭遇“网络瓶颈”——AI训练为什么卡在了线上?

3. 闲置GPU集群每日损失可达数百万美元

4. IB 交换机 vs 普通交换机:AI 集群怎么选?选错直接亏百万

5. 从芯片到集群:AI算力瓶颈如何沿产业链传导

6. 万卡集群的”神经系统”:AI智算中心网络架构的5层蛋糕与选型实战

7. 华为灵衢网络:打破AI算力“通信墙”

8. AI数据中心连接之战:铜退光进是真的吗? CPO时代供应链利润分配有什么变化?

9. 花旗Computex观察:CPO技术迎来转折点,焦点转向机架级部署

10. 中美 AI 基建后半场——通信赛道深度分析(华为通信这块确实亮眼)

11. AI 集群真正的瓶颈, 是芯片之间怎么通讯

12. 中国团队突破瓶颈!不加GPU,万卡集群算力暴涨15%

13. 如何克服人工智能集群网络挑战

14. AI“吃不饱、消化慢”?AI数据中心的真正瓶颈:电力与通信

15. AI 基建三元素—通信

16. AI 数据中心网络(AIDC Networking) 成为 AI 基础设施核心瓶颈

17. 【产业机遇】风口在AI 网络的超线性瓶颈

18. AI算力产业链瓶颈传导的底层逻辑

19. AI训练数据传输优化指南:网络带宽、存储IO、数据管道

20. 华为昇腾950新引入的集合通信处理器技术解读

21. 从训练同步到推理服务,AI网络架构的核心挑战与选型指南

22. 有人把AI未来3年的核心瓶颈排了个序:\x0a\x0a1. 存储(HBM + DRAM + eSSD,已经涨价、签长单、利润兑现)\x0a2. 光互连(800G / 1.6T + Scale-Up + Scale-Across,连接接棒算力)\x0a3. 先进封装(CoWoS + CoPoS + HBM封装,HBM和GPU放量的前提)\x0a4. ASIC + Networking(自研芯片、交换芯片、SerDes、DSP,MRVL/AVGO核心位置)\x0a5. 电力 / AI Factory(变压器、电网、UPS、800V DC、BBU,并网容量是真瓶颈)\x0a6. 液冷(DLC、CDU、冷板,高功率机柜必选项)\x0a7. 核能 / 发电(长期空间巨大,但兑现节奏慢于电力设备)\x0a8. PCB / ABF / CCL(AI服务器和先进封装配套材料,真实受益但控制力弱于前面)\x0a9. MLCC / 被动元件(高频高压高功率带来用量提升,属于配套瓶颈)\x0a10. 半导体设备(检测、量测、测试、先进封装设备,卖水给淘金者)\x0a11. Physical AI(机器人、自动驾驶、工业AI,空间大但2026仍偏预期)\x0a12. Agent / 数据层(方向确定,但赢家和利润分配还不清晰)\x0a13. 稳定币 / AI金融(AI Agent支付层,空间大但商业化还早)\x0a\x0a未来三年市场会越来越关注:谁是真瓶颈,谁能把瓶颈兑现成利润,谁控制下一代架构。

23. AI集群的隐形瓶颈:数据中心交换机,从"配角"到"算力立交桥"的产业跃迁

24. AI芯片综述:内存与通信瓶颈

25. 全球AI算力大战变天:十万卡算力集群时代,网络已成新瓶颈

26. AI 集群真正的瓶颈,正在从 GPU 转向网络、电力和液冷

27. 集群通信网络与NCCL:分布式训练的通信骨架

28. OpenAI 搞定了 AI 训练的最大瓶颈:数十万块 GPU 如何完美同步协作?

29. 交换网络是下一个AI投资风口

30. 为什么AI数据中心离不开光通信?Lumentum财报深度拆解

31. 大模型分布式训练\u002F推理网络性能调优指南:从瓶颈定位到落地优化 - 哔哩哔哩

32. 51.2T交换机选型指南:如何构建更适合AI集群的高速网络底座?

33. 科普篇:007期 交换机,在AI赛道里扮演什么角色

34. 超智融合时代,我们到底需要什么样的AI高速网络?

35. 太共情了!上周跟一个做AI infra的朋友喝酒,他抱怨说又被RoCE坑了一次。   他们那个集群跑的是MoE架构的大模型,通信量本来就大。某次训练任务跑了一半,突然整个集群的性能掉了一大截,一看监控,PFC死锁了。几个人熬了一整夜,调整水线参数、重启交换机,折腾到天亮才恢复。   “如果是IB,根

36. 国家超算互联网核心节点上线了,直接落地了三套万卡规模的国产AI超集群,也是全国首个实现3万卡部署、且实际投入运营的最大国产AI算力池。这里面,真正关键的是“可运营”。 过去我们建算力,有点像攒电脑,一块块显卡往上加。但当大模型跑到万亿参数级别时,拼凑式的算力就行不通了,通信瓶颈、调度效率都会成为致

37. AI算力致命伤!博通总监点名“三大瓶颈”,产能缺口恐持续至2027

38. 里程碑!3套国产AI万卡超集群同时上线国家级算力枢纽

39. 光通信全线大涨!6G突破叠加AI算力狂飙,产业进入加速期

40. AI算力决战: 薄膜铌酸锂凭什么成关键? 随着LLM参数迈向万亿级,AI算力中心流量指数爆炸。薄膜铌酸锂(TFLN)正从技术层面破解高速数据互联瓶颈,成为AI集群互联的“新基建”核心。 传统硅光调制器在高频下损耗急剧上升,InP方案又受限于高成本和产能瓶颈。 TFLN调制器理论上具备>100GHz的

41. 英伟达AI版图再扩张!数据中心以太网交换机收入暴增193%,悄然登顶全球第一

42. 盘中拉涨超6%!光通信公司Applied Optoelectronics宣布:收到超大规模客户首笔1.6T收发器订单

43. 鸿海法说会:计划2026年资本支出增加30%,CPO交换机全年出货预计10000台

44. 光通信大会(2026 OFC):电信大会变成AI大会,焦点是“如何在更小空间塞入更高密度光纤"

45. OFC 2026前瞻:硅光子与CPO如何重塑下一代AI互联体系

46. AI训练最卡脖子的其实不是GPU。  这两年AI火得发烫,大家都盯着GPU算力争破头,可等万卡集群一落地,问题变了——卡脖子的换成了“网络”。 以前CPU节点一台机器插一张网卡就行,现在GPU节点得塞八张甚至更多,网络用量直接翻了十倍到二十倍。关键是万卡训练要的是纳秒级时延、无损传输,可国内用户

47. 网络才是万卡集群的“命门”,国产IB带来新赛道 做了三年算力渠道,越来越觉得:卖GPU的时代正在过去,卖高速网络解决方案的时代来了。尤其是万卡级以上集群,网络成本占比越来越高,而且直接决定了算力利用率。 以前我们给客户推方案,网络这块很尴尬:进口IB利润薄(价格透明+受制于上游),RoCE售后成本

48. 【#中国AIGC产业峰会#金句时间】太初元碁首席产品官、高级副总裁洪源:大模型效率的提升反而带来了计算需求的增加,国产算力也迎来了非常好的发展机会,但还需要解决大规模集群服务能力、Agentic AI计算效率和生态这三个问题。

49. 重磅登顶!“灵晟”问鼎全球超算TOP500,中国刷新世界算力新高度

50. 万卡集群打造上海智算高地

51. 4台迷你主机组集群跑大模型:3个月踩坑实录,延迟才是真瓶颈 | Alex Ziskind

52. 十万卡级AI集群的实际运行效能有多高?可靠性如何解决大规模功耗与网络瓶颈?

53. 网络决定AI性能——Allegro 网络万用表可视化与故障定位方案

54. OFC 2026深度:Scale Across重构AI数据中心网络,千兆瓦级集群的光互联革命

55. Ciena:超大规模AI集群开放互联架构与光网络技术演进

56. 超节点内部光交换技术优化,能否彻底解决AI集群通信瓶颈?

57. 百度万昳:详解AI集群三大场景光网络需求及技术路线选择

58. MRC百万卡集群协议完成国产适配!昇腾平头哥算力集群效率大涨

59. OpenAI携手5大巨头发布MRC协议,重塑大规模AI训练网络架构

60. 千卡集群如何做到3周交付?图能科技的“供应链+组网”实战

61. 提气!一张全自研高速网正撑起中国算力大动脉

62. 为什么超大规模AI集群的GPU利用率普遍低于行业平均水平?

63. 百亿真实数据开源:首个AI基础设施运维智能体评测基准来了

64. 国内首个智算运维 Agent 基准开源!信通院 × 无问芯穹 AISHPerf,用百亿真实数据丈量 AI 运维真实实力

65. AI 集群真正的瓶颈,正在从 GPU 转向网络、电力和液冷

66. 从芯片内部到万卡集群,一张图看懂AI万卡集群全栈网络互联架构

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章