AI算力竞争的主战场正从训练转向推理。随着大模型应用落地和Token消耗量激增,高性价比的推理算力成为新焦点。英伟达整合LPU技术、OpenAI多线布局等信号,正引发AI芯片架构和产业格局的深度重构,预示着一个全新的推理时代已经开启。
智能速览
英伟达计划发布整合LPU技术的新推理芯片,OpenAI将成为其最大客户之一。
AI算力竞争主战场已从训练转向推理,性价比成为核心竞争要素。
春节期间中国大模型Token调用量激增,首度超越美国模型。
专用推理芯片LPU崛起,挑战GPU在推理环节的主导地位。
新一代国产算力芯片在算力、互联和成本控制上取得关键性突破。
AI算力系统正演进为三层网络架构,以适应Agent落地需求。
精华内容
推理需求的爆发正深刻改变AI算力版图。从芯片架构到系统设计,从国际巨头到国产力量,一场围绕高性价比推理算力的变革正在全面展开。
推理需求爆发
AI推理算力需求的扩张,背后是大模型货币化和Agent落地提速两大驱动力。以春节期间为例,国内头部大模型推理量大幅增长,其中豆包除夕当天推理吞吐量达633亿tokens。全球数据显示,中国模型API调用量在2月第二周以4.12万亿Token首次超过美国模型的2.94万亿,并在下一周冲高至5.16万亿,三周大涨127%。
这表明,每一次模型调用和Agent任务执行,背后均需要海量的推理算力支撑,算力需求结构已从“单次训练”向“海量Token消耗”转变。
LPU挑战GPU
英伟达斥资200亿美元获取Groq核心技术,并计划发布整合LPU技术的新推理芯片,这标志着纯推理芯片的重要性已获顶级玩家认可。LPU与传统GPU的核心差异在于架构,LPU针对推理的预填充和解码两个阶段进行了专项优化,尤其在延迟和内存带宽这两大瓶颈上效率更高。
申万宏源研究判断,未来AI芯片将形成技术分工:训练端沿用GPU-HBM组合,推理端则演变为ASIC+LPU-SRAM+SSD的组合方案,专注推理的厂商迎来发展机遇。
算力系统革新
随着应用场景从Chatbot转向Agent,算力系统对延迟、吞吐与思考深度的要求同步提升,推动系统架构向三层网络演进。第一层是搭载SRAM的快反应层,提供极致低延迟;第二层是使用CPU集群的慢思考层,负责复杂逻辑推演;第三层则是通过DPU管理的SSD记忆层,存储Agent的长期记忆。
英伟达策略也随之调整,已与Meta完成首次大规模纯CPU部署,以支持其广告智能体,标志着其正超越单一的GPU销售模式。
国产芯片突破
国产推理芯片的技术升级正带来市场预期差。新一代产品支持FP8/MXFP8等低精度格式,算力达到1P和2P;向量算力大幅提升,互联带宽增至2TB/s。尤为关键的是,芯片层面实现了PD分离,通过不同规格的HBM分别优化Prefill和Decode阶段的成本。
其中面向Prefill的PR版本采用低成本HBM,可大幅降低推理前期的投资成本,预计2026年Q1推出。供应链数据也佐证了这一趋势,某头部封测企业的高性能计算芯片封装收入在两年内从0.5亿增至18.2亿。
AI算力正迎来以推理为核心的范式转移。从专用架构到多元供应链,高性价比推理能力的供给将成为决定未来AI应用普及的关键。在这场涉及技术、成本和效率的全面变革中,谁能提供更优的解决方案,谁就将掌握下一轮发展的主动权。