GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

源自公众号:新智元

02-24 21:20

一家初创公司Taalas颠覆传统,将AI模型直接蚀刻在芯片上。这种“暴力美学”实现了17,000 tokens/秒的极速和极低成本,但也引发了关于通用性与专用性、技术迭代风险的深刻探讨,为AI硬件的未来提供了全新视角。

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜智能速览

  • 核心技术是将大模型权重直接固化在芯片的晶体管上。

  • 运行Llama 3.1 8B模型的速度高达17,000 tokens/秒。

  • 其功耗仅为传统方案的1/10,成本降至1/20。

  • 芯片出厂后无法更换或升级模型,存在被淘汰的巨大风险。

  • 这代表了AI硬件领域“通用平台”与“极致专用”的两种发展路线对立。

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜精华内容

这场豪赌的核心,是用一种看似复古的物理固化,挑战软件定义一切的硅谷正统,并重新定义了速度、成本与灵活性的边界。

绕开内存墙的物理美学

Taalas HC1芯片的核心思路,是彻底绕开传统GPU的“内存墙”瓶颈。它不再通过软件调度数据,而是将Llama 3.1 8B模型的每一个权重,都直接对应为芯片上的特定晶体管。

复杂的矩阵乘法运算,直接通过物理电路的电流来完成,无需反复从显存中搬运数据。这使其能抛弃昂贵的HBM显存和复杂的液冷系统,实现了架构上的极简。

十倍于业界的性能飞跃

这种物理固化的方式带来了惊人的性能提升。HC1运行Llama 3.1 8B的速度达到17,000 tokens/秒,比业界最快的Cerebras芯片快近10倍,比英伟达B200更是高出近50倍,让AI回复呈现出未卜先知般的速度。

更重要的是,其成本仅为传统方案的1/20,十张卡的功耗总和仅需2.5千瓦,用普通风冷即可解决。

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

锁死的命运与致命赌注

一切命运的馈赠,都早已在暗中标好了价格。HC1芯片在出厂的那一刻,其命运就被彻底锁死,它永远无法更换模型,也无法进行微调,只能运行Llama 3.1 8B这一个模型。

在AI模型日新月异的今天,将芯片与一个特定版本的历史模型强行绑定,一旦模型被淘汰,这块尖端的硅片可能瞬间变为昂贵的电子垃圾。

两条路线与未来之争

这背后是AI硬件发展路线的根本分歧。一方是以“芯片之神”Jim Keller为代表的通用计算平台信仰,追求灵活性;另一方则是Taalas所走的极致专用路线,用固化换效率。

这种模式或许并非为人类交互设计,其恐怖的速度更适合AI智能体间的通信。正如人脑在特定任务上的高效,未来世界或许需要海量被固化在硅片中的“电子工匠”,去完成那些单一、极速且廉价的任务。

Taalas的尝试,无论成败,都已撕开传统AI硬件的一道裂痕。它迫使我们思考,AI的未来究竟是追求云端的全能神明,还是遍布物理世界的亿万极速工匠?科技树的走向,正面临新的抉择。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
1评论

  • 精彩
  • 最新
  • 图片这人有点眼熟

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章