长期以来,人工智能(AI)算力市场由英伟达(NVIDIA)凭借其GPU和CUDA生态系统主导,形成了近乎垄断的局面。然而,随着谷歌(Google)自研的TPU(张量处理器)从内部使用的秘密武器逐步转向商业化,市场格局正悄然发生改变,由“一家独大”向“双雄博弈”演变。
要理解这场竞争,首先需要了解两种芯片的根本区别。英伟达的GPU(图形处理器)最初为处理游戏和图形渲染而生,其强大的并行计算能力恰好契合了深度学习兴起时大规模数据训练的需求。为了兼容各类AI算法,GPU保留了大量复杂的控制逻辑,通用性极强。但这极致的灵活性也带来了在执行特定AI任务时能效不高的代价。GPU真正的护城河在于其CUDA软件生态,经过近二十年的积累,全球绝大多数AI代码默认在CUDA上编写和优化,形成了巨大的技术惯性和开发者依赖。

与此相对,谷歌的TPU(张量处理器)是专为AI计算量身定制的专用集成电路(ASIC)。它移除了所有与AI矩阵运算无关的组件,专注于一件事,因此在处理特定AI负载时能展现出极高的效率和能效比。结合谷歌自研的光路交换(OCS)互联技术,TPU集群在大规模AI训练和推理任务上表现出显著的成本优势。有分析指出,对于一些大型客户,采用TPU方案的单位有效算力成本可能远低于英伟达的方案。

过去,TPU主要供谷歌内部使用,支撑其搜索、Gemini大模型等核心业务。但现在,谷歌的战略正在转变。它开始将TPU作为Google Cloud的核心差异化卖点,通过云服务的方式向外部客户开放。这一转变直接冲击了英伟达的商业模式。据悉,像Anthropic、Meta等科技巨头,为降低成本和分散供应链风险,已开始考虑或实际采用谷歌的TPU。例如,有报道称Meta正与谷歌商谈价值数十亿美元的TPU采购协议。

尽管如此,认为TPU能迅速“干掉”英伟达还为时过早。英伟达的霸主地位依然稳固,主要得益于其难以撼动的CUDA生态。对于绝大多数初创公司和中小企业而言,迁移代码框架(例如从主流的PyTorch迁移到适配TPU的JAX框架)意味着高昂的人力成本和时间风险。此外,TPU目前主要通过谷歌云提供服务,无法满足银行、国防等对数据安全要求极高、必须进行本地私有化部署的客户需求,而英伟达则可以提供独立的硬件销售,满足这一市场。
同时,英伟达在先进芯片的产能方面也占据优势,已提前锁定了大量的先进封装产能,这在短期内限制了谷歌TPU的大规模量产。英伟达自身也在不断迭代技术,其高层回应称,尽管谷歌很强,但英伟达的技术在多功能性和灵活性上仍“领先一代”。
谷歌TPU的崛起并非要立即替代英伟达,而是在AI算力市场撕开了一道重要的口子。它的存在为市场提供了另一种选择,迫使英伟达在定价和合作方式上做出让步,打破了其绝对的垄断地位。未来,AI算力市场很可能不是一场零和博弈,而是进入一个新的竞争格局:英伟达继续凭借其开放的生态和通用硬件占据通用算力市场的主导,而谷歌则以其高效、高性价比的闭环生态系统,在云端和大型客户市场形成强有力的制衡。这场算力战争的核心,已从单纯的“抢芯片”升级为对成本、效率和生态的全方位博弈。