面对AI大模型日常使用的高成本挑战,英伟达宣布将在3月推出专为推理设计的芯片,标志着其正式加码这一重要赛道。此举不仅是对谷歌TPU等竞争对手的直接回应,更获得了核心客户OpenAI的率先订单,预示着AI基础设施领域将迎来新一轮的成本与效率变革。
智能速览
英伟达将于3月GTC大会发布全新推理芯片。
该芯片旨在优化大模型日常使用成本,与训练GPU形成互补。
OpenAI已成为这款未发布芯片的首批客户之一。
新芯片技术源于英伟达斥资200亿美元收购的初创公司Groq。
芯片或采用SRAM与HBM结合方案,以降低对外部HBM的依赖。
精华内容
英伟达此举并非一时兴起,而是其在AI芯片全领域布局的关键一步。这款新芯片背后,既有对市场需求的精准洞察,也整合了顶尖的技术收购成果。
为何专做推理芯片
当前,英伟达的GPU在AI模型训练阶段占据主导地位,负责将海量数据“炼成”大模型。但在模型训练完成后的推理阶段,即日常用户调用时,继续使用高性能GPU可能面临成本过高的问题。
相比之下,谷歌的TPU、亚马逊的Trainium等专用推理芯片,在处理日常请求时成本效益更优。英伟达推出专用推理芯片,正是为了补齐其在成本敏感型推理市场的短板,形成训练与推理的全覆盖能力。
OpenAI的提前锁单
据《华尔街日报》报道,尽管芯片尚未发布,但OpenAI已成为其确定客户。这一安排与双方近期的资本动态紧密相关。OpenAI刚刚完成一轮巨额融资,估值达到1100亿美元,其中英伟达投资了30亿美元。
这笔投资与芯片订单的结合,显示了英伟达通过资本绑定核心客户的战略意图,也确保了新产品一经发布便有稳定的大额订单支撑,进一步巩固其在AI算力供应链中的核心地位。
Groq技术的融入
新款推理芯片的技术基础,很大程度上源于英伟达去年对初创公司Groq的收购。英伟达斥资200亿美元,不仅获得了Groq全部技术,还将这位谷歌初代TPU的设计者之一招致麾下。
Groq的核心技术路线是放弃传统GPU外置的HBM(高带宽内存),转而大量使用SRAM(静态随机存取存储器),后者直接集成在芯片内部。外界预测,英伟达的新芯片可能采取SRAM与HBM结合的方案,通过提高SRAM占比来降低对昂贵且供应紧张的HBM的依赖,从而优化成本与供应稳定性。
英伟达推出专用推理芯片,不仅是对其产品线的关键补强,也可能重塑AI推理市场的成本结构。随着技术细节在三月GTC大会揭晓,这是否会引发新一轮的算力竞赛,并为AI应用的普及铺平道路,值得业界持续关注。
关键评论
有观点认为,英伟达的芯片在推理领域同样是统治级别的存在,并非只擅长训练。
有评论担心,推广成本更低的推理芯片可能会对英伟达自身高利润的GPU业务造成挤压。
有用户推测,新款推理芯片可能主要供应给OpenAI这类大客户,而非面向零售市场。