成本暴降至1/20,但只能运行一个模型,Taalas能颠覆GPU吗?

源自22位全网作者

02-24 07:22

近期,一家名为Taalas的芯片初创公司凭借其首款产品HC1,在人工智能领域引发了广泛关注。其核心理念是“模型即芯片”,通过将特定的大语言模型直接“刻录”到硅片中,挑战由传统GPU主导的AI算力格局。

成本暴降至1/20,但只能运行一个模型,Taalas能颠覆GPU吗?

传统GPU,如英伟达的产品,其强大之处在于通用性。它们可以运行各种AI模型,背后有成熟的CUDA软件生态支持。然而,这种通用架构也带来了固有的瓶颈。在AI推理任务中,GPU需要不断地在独立的存储单元(如HBM高带宽内存)和计算单元之间搬运庞大的模型参数。这个过程被称为“内存墙”问题,它消耗了大量的能量和时间,是当前AI推理硬件成本高、功耗大的主要原因之一。为了缓解这一问题,行业投入了巨大的资源发展先进封装、高速互联和液冷等复杂技术。

Taalas则选择了一条截然不同的、更激进的专用化路线。其HC1芯片的核心技术可以概括为“存算合一”和“极致专用”。它采用掩模只读存储器(Mask ROM)工艺,在芯片制造阶段就将Meta的Llama 3.1 8B模型的权重参数直接编码进芯片的物理结构中,与计算逻辑融为一体。这从根本上消除了数据搬运的需求,不再需要昂贵的外部HBM内存。

成本暴降至1/20,但只能运行一个模型,Taalas能颠覆GPU吗?

这一设计带来了显著的优势。根据Taalas公布的数据,HC1芯片在运行特定模型时,单用户推理速度可达每秒17,000个token,数倍甚至数十倍于当前顶级的GPU或其他AI加速器。同时,由于省去了HBM并简化了架构,其制造成本和功耗也大幅降低,据称成本仅为同等GPU方案的二十分之一,功耗低一个数量级,仅需常规风冷即可运行。此外,由于硬件的极度专用化,软件栈也得到极大简化,降低了开发和维护的复杂度。

然而,这种极致的效率并非没有代价,其短板也同样突出。HC1最大的局限在于彻底牺牲了灵活性。它只能运行Llama 3.1 8B这一个固定的模型,无法升级或更换。如果模型更新换代,这块芯片就可能失去价值。这好比一台只能玩《塞尔达传说》且游戏被焊死在主板上的游戏机,想玩其他游戏只能更换整台机器。为了提供有限的灵活性,HC1保留了少量SRAM用于支持LoRA微调,但这无法改变其不可编程的本质。

Taalas的出现,标志着AI算力市场可能进入一个更加分化和精细化的阶段。它赌的是,随着AI产业的成熟,一些模型将在特定应用场景中变得足够稳定和“好用”,其生命周期足以支撑为其定制专用芯片的投入。对于那些需要大规模、高频次运行固定模型的应用(如某些垂直领域的实时对话、自动驾驶的感知决策、机器人的快速反应等),Taalas的方案可能提供极具吸引力的性价比。在这种场景下,极致的低延迟、低成本和高能效,远比通用性更为重要。

Taalas能否颠覆传统GPU?从目前看,它并非要全面取代GPU。GPU在模型训练和需要高度灵活性的研发迭代环节,其地位短期内难以撼动。Taalas瞄准的是日益庞大的AI推理市场,特别是那些对成本和效率极度敏感的部署场景。它的实践证明,放弃通用性,换取专用化带来的极致效率,是一条可以撕开市场缺口的可行路径。

Taalas的“模型即芯片”方案,是对当前主流AI硬件范式的一次大胆挑战。它或许不会成为唯一的答案,但它揭示了一种可能性:未来AI算力市场可能不再是通用芯片一家独大,而是通用与专用方案并存,根据不同应用场景的需求,选择“最适合”而非“最万能”的芯片。这场关于效率与灵活性之争,才刚刚拉开序幕。

内容由AI生成

精选参考来源

1. 初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍

初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍 初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍DeepTech深科技1771668972

2. 这是要出大事了。。。这个春节,有个叫Taalas的芯片新公司横空出世,它干了一件让英伟达震惊的事情:直接把大模型装在芯片...

这是要出大事了。。。这个春节,有个叫Taalas的芯片新公司横空出世,它干了一件让英伟达震惊的事情:直接把大模型装在芯片... 这是要出大事了。。。这个春节,有个叫Taalas的芯片新公司横空出世,它

3. #Taalas把大模型以ASIC的方式实现#传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据、耗高带...

#Taalas把大模型以ASIC的方式实现#传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据、耗高带... 传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据、耗

4. #Taalas把大模型以ASIC的方式实现# 传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据、耗...

#Taalas把大模型以ASIC的方式实现# 传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据、耗... 传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据

5. Taalas引发争议:AI的端侧时代开启?最近在硅谷和华尔街,都在传一个数字:17,000。 不是道指、纳指,而是 T...

Taalas引发争议:AI的端侧时代开启?最近在硅谷和华尔街,都在传一个数字:17,000。 不是道指、纳指,而是 T... Taalas引发争议:AI的端侧时代开启?最近在硅谷和华尔街,都在传一个数

6. 刷到一个公司Taalas,一家Al芯片公司,团队只有二十多人,却已经融资超过2亿美元。首款产品HC1走了一条极端路线:用...

刷到一个公司Taalas,一家Al芯片公司,团队只有二十多人,却已经融资超过2亿美元。首款产品HC1走了一条极端路线:用... 刷到一个公司Taalas,一家Al芯片公司,团队只有二十多人,却已经融资

7. 这是要出大事了。。。

这是要出大事了。。。 这个春节,有个叫Taalas的芯片新公司横空出世,它干了一件让英伟达震惊的事情:直接把大模型装在芯片面上。。。这样什么内存带宽限制之类都不存在了。。。而且性能非常夸张:在这块专用

8. 【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1 8B整个模型和参数直接蚀刻到硅片上。不用显存,不...

【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1 8B整个模型和参数直接蚀刻到硅片上。不用显存,不... 【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1

9. 颠覆性突破:Taalas“模型即芯片”架构重构AI硬件格局,效能与成本双重降维打击近日,一家名为Taalas的芯片初创公...

颠覆性突破:Taalas“模型即芯片”架构重构AI硬件格局,效能与成本双重降维打击近日,一家名为Taalas的芯片初创公... 颠覆性突破:Taalas“模型即芯片”架构重构AI硬件格局,效能与成本双

10. 1.69亿融资押注专用芯片:Taalas要靠“去GPU化”改写AI算力格局

1.69亿融资押注专用芯片:Taalas要靠“去GPU化”改写AI算力格局 1.69亿融资押注专用芯片:Taalas要靠“去GPU化”改写AI算力格局钛媒体APP1771811435 2026年2月2

11. 一个疯子,造出便宜100倍的AI芯片

一个疯子,造出便宜100倍的AI芯片 一个疯子,造出便宜100倍的AI芯片傅盛1771838166 25个人,3000万美金,两年半。做出了一块碾压英伟达旗舰GPU 10倍的芯片。不是PPT,不是实验

12. 【初创用3000万美元造一颗不可编程的AI芯片,推理速度却是Nvidia最强GPU的50倍】2026 年 2 月 21 ...

【初创用3000万美元造一颗不可编程的AI芯片,推理速度却是Nvidia最强GPU的50倍】2026 年 2 月 21 ... 【初创用3000万美元造一颗不可编程的AI芯片,推理速度却是Nvidia

13. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 编辑:定慧今天是大年初六,年还没过完。但有一个新闻却淹没在各种消息中。这可能是今年最重要的AI新闻,但现在依然还没什么

14. 昨天,一家成立不到三年的多伦多芯片公司扔下了一颗核弹。他们不是做大模型的,不是做应用的,而是做了一件听起来很复古的事:把...

昨天,一家成立不到三年的多伦多芯片公司扔下了一颗核弹。他们不是做大模型的,不是做应用的,而是做了一件听起来很复古的事:把... 昨天,一家成立不到三年的多伦多芯片公司扔下了一颗核弹。他们不是做大模型的

15. 24人团队硬刚英伟达!AMD前高管梦之队出手,新芯片每秒17000个token

24人团队硬刚英伟达!AMD前高管梦之队出手,新芯片每秒17000个token 鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI造芯片的还有高手?刚刚推出的一款最新芯片,直接冲上硅谷热榜。峰值推理

16. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 今天是大年初六,年还没过完。但有一个...

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 今天是大年初六,年还没过完。但有一个... GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/

17. 24 人团队研发新芯片每秒 17000 个 token,将对 AI 芯片市场带来哪些影响?

24 人团队研发新芯片每秒 17000 个 token,将对 AI 芯片市场带来哪些影响? 第一反应不是”哇好快”,然后”等等,才24个人?”,牛逼。关注芯片的领域的人可能会了解的多一点,一颗台积电6

18. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度

把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度 导读:大模型推理速度受限于“内存墙”的硬件限制,那有没有可能,直接把模型这个“软件”,变成硬件本身?也许AI推理的最终答案不是更强

19. 又一家AI芯片公司:另辟蹊径挑战英伟达

又一家AI芯片公司:另辟蹊径挑战英伟达 又一家AI芯片公司:另辟蹊径挑战英伟达半导体行业观察1771566021 公众号记得加星标⭐️,第一时间看推送不会错过。向一组 AI 张量引擎添加大容量 SRA

20. 24 人团队研发新芯片每秒 17000 个 token,将对 AI 芯片市场带来哪些影响?

24 人团队研发新芯片每秒 17000 个 token,将对 AI 芯片市场带来哪些影响? 提问账号你好。下次用算法扒垃圾桶来发问题的时候,记得将补充说明的格式处理一下。这问题扒的新闻来自不讲新闻道德

21. 24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token

24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token 24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token36氪1771652741 造芯片的还有高

22. 24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token

24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token 24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token量子位1771655102 鹭羽 发自 凹非寺量子位
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章