张大妈

一块不能编程的芯片,凭什么跑赢所有 GPU

源自公众号:蛋黄派的日常

02-24 21:19

一家名为Taalas的公司将Llama 3.1模型直接蚀刻进芯片晶体管,实现了比GPU快近10倍、成本低20倍、功耗仅1/10的革命性突破。这不仅是技术上的飞跃,更可能重塑AI的边际成本结构,将算力竞争的核心彻底转向电力,为AI硬件的未来发展提供了全新的想象空间。

一块不能编程的芯片,凭什么跑赢所有 GPU智能速览

  • Taalas将Llama 3.1模型直接蚀刻进芯片,推理速度达17000 tokens/s。

  • 此方案将算力从边际成本变为固定成本,Token成本几乎只剩电费。

  • 芯片的致命缺陷是无法升级,只能运行单一固定模型。

  • 未来可能是分层架构:GPU负责调度,专用芯片执行固定任务。

  • Transformer架构足够稳定,或将成为下一个固化的硬件指令集。

  • 低功耗芯片将推动AI推理从数据中心走向分布式边缘计算。

一块不能编程的芯片,凭什么跑赢所有 GPU精华内容

当AI算力的竞赛还在堆叠GPU时,一条全新的路径已然出现:将模型本身变为硬件。这不仅是速度的飞跃,更是对AI经济结构的根本性重塑。

硬件即模型

Taalas公司的核心技术是将Meta的Llama 3.1 8B大模型的权重,直接转变为硅芯片上的物理晶体管电路。这意味着模型的32层Transformer结构成为了硬件实体,数据输入后,电信号直接在物理层间流动完成推理,无需读写外部存储器。这种架构实现了每秒17000个Token的惊人速度,远超GPU方案的1800 tokens/s,同时建造成本仅为后者的1/20,功耗也只有1/10,并彻底省去了高带宽内存、先进封装和液冷系统等昂贵组件。

成本的颠覆

在传统GPU方案中,生成Token的边际成本主要包含算力折旧和电力消耗。算力成本不仅指GPU本身,更包含了HBM、散热、互联等一整套昂贵系统的折旧。Taalas的方案从根本上改变了这一点,它将“算力”这一变量成本转变为了“芯片制造”这一固定成本。一旦芯片制造完成,后续每生成一个Token,消耗的几乎就只有电力。这使得Token的边际成本结构被极大简化,电力在AI成本竞争中的权重,从“重要”上升为“唯一”。

无法升级的代价

这种极致效率的背后,是一个根本性的约束:芯片只能运行被刻入的那个单一模型。一块刻死Llama 3.1 8B的芯片,无法升级到未来的Llama 4,只能面临报废。这让人联想到计算机史上的ENIAC,其编程方式就是物理接线,程序与硬件高度绑定。冯诺依曼架构的出现,通过将程序存储于内存,实现了硬件与软件的分离,奠定了现代计算机的基础。Taalas的方案,似乎在某种程度上回到了“程序即硬件”的ENIAC时代,牺牲了通用性以换取极致效率。

分层固化之路

一个可行的演进方向是采用分层架构。大模型的使用方式正从“一个模型做所有事”转向分工协作。上层可以是一个迭代迅速、能力强大的“调度模型”,运行在通用GPU上,负责理解用户意图并拆解任务。下层则是一组执行专用任务的“子模型”,如翻译、摘要、代码生成等。这些任务模式相对固定,适合被固化到Taalas式的专用芯片中,实现极致的速度和成本效益。这种快变部分留在软件,慢变部分沉降到硬件的模式,正是计算产业几十年的发展规律。

Transformer指令集

更进一步,不固化整个模型,而是固化最稳定的核心计算模式,或许是更优解。自2017年提出以来,Transformer架构的核心计算(如Self-Attention)已稳定近8年,在AI领域堪称“地质年代”。这使其具备了成为下一个硬件指令集的潜力。可以设想一种专为此优化的芯片,将Transformer的核心计算逻辑固化为物理电路,任何基于此架构的模型权重都可加载运行。它将比GPU更高效,比单模型芯片更通用,如同CPU领域的x86或ARM指令集一样。

电力格局之变

当AI硬件走向低功耗的专用芯片,推理将不再局限于大型数据中心,而是可以分布式部署在任何有电的角落,如边缘设备、基站甚至家用路由器。这将引发AI电力竞争格局的深刻变革。竞争的焦点将从“谁能建起更便宜的数据中心”,转变为“谁能提供更便宜的终端用电”。数据中心电价可通过选址优化,但终端电价则考验着整个国家的电网效率与能源政策,AI的地缘政治影响或将因此改变。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章