Taalas将大模型刻成ASIC:推理速度万级Token,成本仅为传统1/20

源自24位全网作者

02-23 07:15

近期,一家名为Taalas的AI芯片初创公司引发了业界的广泛关注。该公司采取了一种激进的技术路线,将大语言模型以ASIC(专用集成电路)的方式实现,即把模型本身“刻”在芯片上,旨在从根本上解决当前AI推理算力的核心瓶颈。

传统上,以英伟达GPU为代表的通用算力芯片,如同功能强大的“瑞士军刀”,能够处理各种计算任务。但在运行大模型进行推理时,其遵循的冯·诺依曼架构暴露了固有缺陷。模型参数(权重)存储在HBM(高带宽内存)等外部存储器中,计算时需要不断地将数据在计算单元和存储单元之间来回搬运。这个过程不仅消耗了大量时间与功耗(有分析称超过70%),形成了所谓的“内存墙”,还催生了对昂贵HBM、先进封装和液冷散热等复杂技术的依赖,推高了整个系统的成本和复杂性。

Taalas将大模型刻成ASIC:推理速度万级Token,成本仅为传统1/20

Taalas的思路则是彻底颠覆这一模式,其核心理念是“模型即是计算机”。他们不再将模型视为需要从内存中读取的软件数据,而是通过光刻工艺,将模型的权重和计算逻辑直接固化为芯片物理电路的一部分。这种做法本质上是为特定模型(如其首款产品HC1芯片针对Llama 3.1 8B模型)量身打造一台“专用机”。

这种“存算一体”的设计带来了显著的优势。它彻底消除了数据搬运的瓶颈,“内存墙”不复存在,使得推理速度和能效比得到数量级的提升。根据Taalas公布的数据,其HC1芯片运行Llama 3.1 8B模型时,单用户推理速度可达惊人的每秒17000个token,远超当前主流GPU和其他专用芯片。由于不再需要昂贵的HBM、复杂的封装和散热系统,硬件大幅简化,使得芯片制造成本据称可降至传统方案的二十分之一,功耗也仅为十分之一,标准风冷即可满足散热需求。

Taalas将大模型刻成ASIC:推理速度万级Token,成本仅为传统1/20

然而,这种极致的专用化也带来了显而易见的短板。最核心的问题是缺乏灵活性。芯片一旦制造完成,就只能运行被固化的那一个特定模型。随着AI模型以惊人的速度迭代,今天的前沿模型可能在数月后就变得落后,这意味着这块专用芯片将面临迅速过时的风险,成为“电子垃圾”。这使其更适合那些算法已经成熟、趋于稳定、追求极致性价比的大规模部署场景,而非需要频繁迭代模型的训练和研发环节。

此外,该技术在扩展性上也面临挑战。单颗芯片能容纳的模型大小有限,例如HC1芯片固化的Llama 3.1 8B模型经过激进量化后实际大小仅为数GB。若要运行更大规模的模型,就需要将多张不同的专用卡串联起来,以流水线并行的方式工作。这虽然可行,但会导致单用户的峰值推理速度按芯片数量成比例下降,且系统管理的复杂度也会增加。

尽管存在争议,Taalas的实践标志着AI算力发展进入了一个新的阶段,即从单纯追求通用算力转向更加精细化的专用算力探索。回顾计算历史,当某一种计算任务变得足够重要和普遍时,从通用硬件转向专用硬件(ASIC)几乎是必然趋势,正如比特币挖矿从CPU、GPU演进到专用矿机一样。

Taalas将大模型刻成ASIC:推理速度万级Token,成本仅为传统1/20

从商业角度看,为大模型定制ASIC也具备经济可行性。有分析指出,当一个大模型的应用规模足够庞大,其推理成本高昂时,投入数亿美元研发一款能将推理成本降低20%甚至更多的专用芯片,在经济上是划算的。关键在于,芯片的定制周期能否跟上模型的迭代速度。Taalas声称能将“从模型到芯片”的周期压缩到两个月,如果这一快速工程化能力得到证实,将极大增强该路线的吸引力。

Taalas的探索为AI硬件市场描绘了一个可能的未来:市场将出现分化。一端是以英伟达为首的通用算力巨头,继续服务于模型训练和需要高度灵活性的前沿研究;另一端,则是为那些已经“足够好”且用量巨大的成熟模型提供极致性价比的专用推理芯片。这种“通用+专用”的混合算力格局,不仅可能打破现有市场垄断,也为AI应用的普及和新物种的诞生(如对延迟极度敏感的AI智能体、低功耗边缘设备等)开辟了全新的可能性。

内容由AI生成

精选参考来源

1. #Taalas把大模型以ASIC的方式实现#传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据、耗高带...

#Taalas把大模型以ASIC的方式实现#传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据、耗高带... 传统GPU像万能瑞士军刀,啥都能干但跑大模型不够专精,还要反复搬数据、耗

2. 【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1 8B整个模型和参数直接蚀刻到硅片上。不用显存,不...

【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1 8B整个模型和参数直接蚀刻到硅片上。不用显存,不... 【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1

3. Taalas 把大模型以 ASIC 的方式实现了——也就是说把模型直接写到芯片里,这样什么内存带宽限制之类都不存在了。目...

Taalas 把大模型以 ASIC 的方式实现了——也就是说把模型直接写到芯片里,这样什么内存带宽限制之类都不存在了。目... Taalas 把大模型以 ASIC 的方式实现了——也就是说把模型直接写

4. 这个卡真的能装得下SOTA级别的大模型吗? 给大家带来 Taalas 这个LLM ASIC 卡的深度解析.首先为什么AS...

这个卡真的能装得下SOTA级别的大模型吗? 给大家带来 Taalas 这个LLM ASIC 卡的深度解析.首先为什么AS... 这个卡真的能装得下SOTA级别的大模型吗? 给大家带来 Taalas 这

5. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度

把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度 导读:大模型推理速度受限于“内存墙”的硬件限制,那有没有可能,直接把模型这个“软件”,变成硬件本身?也许AI推理的最终答案不是更强

6. 快50倍省95% 专用AI芯片登场 算力格局生变?

快50倍省95% 专用AI芯片登场 算力格局生变? 快50倍省95% 专用AI芯片登场 算力格局生变?科技思维1771704848 2026年2月,初创公司Taalas推出首款专用AI推理芯片HC1,

7. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度

把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度不二小段1771660131 导读:大模型推理速度受限于“内存

8. 每秒12000 tokens吞吐:Taalas集群跑DeepSeek R1创速度纪录

每秒12000 tokens吞吐:Taalas集群跑DeepSeek R1创速度纪录 每秒12000 tokens吞吐:Taalas集群跑DeepSeek R1创速度纪录IT之家1771637791

9. 应用端推理需求大爆发 全球ASIC芯片迎来黄金发展期

应用端推理需求大爆发 全球ASIC芯片迎来黄金发展期 应用端推理需求大爆发 全球ASIC芯片迎来黄金发展期财联社1756425360 据报道,随着应用端推理需求的大爆发,大厂同步加码定制ASIC芯片以

10. 初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍

初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍 初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍DeepTech深科技1771668972

11. 谷歌TPU芯片:硬件构架及供应链全景梳理一. 谷歌TPU概览谷歌TPU(张量处理单元)是专为AI/机器学习设计的ASIC...

谷歌TPU芯片:硬件构架及供应链全景梳理一. 谷歌TPU概览谷歌TPU(张量处理单元)是专为AI/机器学习设计的ASIC... 谷歌TPU芯片:硬件构架及供应链全景梳理一. 谷歌TPU概览谷歌TPU(

12. 算力核心赛道:ASIC芯片全解析

算力核心赛道:ASIC芯片全解析 算力核心赛道:ASIC芯片全解析股市淘金1757244278 当前全球AI算力需求强劲,随着算力重心由训练端加速转向推理端,ASIC作为推理主要形式景气度持续上升。此

13. 中兴通讯交流更新10101.下一代 5nm 制程 ASIC 芯片已进入流片验证阶段,计划 2026 年 Q1 量产,20...

中兴通讯交流更新10101.下一代 5nm 制程 ASIC 芯片已进入流片验证阶段,计划 2026 年 Q1 量产,20... 中兴通讯交流更新10101.下一代 5nm 制程 ASIC 芯片已进入流

14. #ai芯片##英伟达##AMD# 造芯片的还有高手? 刚刚推出的一款最新芯片,直接冲上硅谷热榜。 峰值推理速度高达...

#ai芯片##英伟达##AMD# 造芯片的还有高手? 刚刚推出的一款最新芯片,直接冲上硅谷热榜。 峰值推理速度高达... 造芯片的还有高手? 刚刚推出的一款最新芯片,直接冲上硅谷热榜。 峰值推理

15. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜新智元1771754976 编辑:定慧

16. 24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token

24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token 24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token36氪1771652741 造芯片的还有高

17. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 编辑:定慧今天是大年初六,年还没过完。但有一个新闻却淹没在各种消息中。这可能是今年最重要的AI新闻,但现在依然还没什么

18. #a股#谷歌的Ai芯片 一个简单粗暴的备胎计划——谷歌TPU。 为什么TPU能成为如此有效的压价工具?根本原因在于其与...

#a股#谷歌的Ai芯片 一个简单粗暴的备胎计划——谷歌TPU。 为什么TPU能成为如此有效的压价工具?根本原因在于其与... 谷歌的Ai芯片 一个简单粗暴的备胎计划——谷歌TPU。 为什么TPU能成为

19. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 今天是大年初六,年还没过完。但有一个...

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 今天是大年初六,年还没过完。但有一个... GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/

20. 地球下一个版本的物种——硅基海洋里随机涌现出来的智能体。是的,人工智能是随机涌现出来的,就像生物进化一样,通过大规模的冗...

地球下一个版本的物种——硅基海洋里随机涌现出来的智能体。是的,人工智能是随机涌现出来的,就像生物进化一样,通过大规模的冗... 地球下一个版本的物种——硅基海洋里随机涌现出来的智能体。是的,人工智能是

21. 今晚达子大跌,博通大涨说明什么?不是人工智能芯片需求减弱了,而是达老大占比太高。企业觉得不能让他一家独大,找其他企业做合...

今晚达子大跌,博通大涨说明什么?不是人工智能芯片需求减弱了,而是达老大占比太高。企业觉得不能让他一家独大,找其他企业做合... 今晚达子大跌,博通大涨说明什么?不是人工智能芯片需求减弱了,而是达老大占

22. 算力格局生变!OpenAI不满主流AI芯片,自研+多供应商战略重塑行业生态! 据行业消息人士透露,OpenAI首席执行官...

算力格局生变!OpenAI不满主流AI芯片,自研+多供应商战略重塑行业生态! 据行业消息人士透露,OpenAI首席执行官... 算力格局生变!OpenAI不满主流AI芯片,自研+多供应商战略重塑行业生

23. 24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token

24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token 24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token量子位1771655102 鹭羽 发自 凹非寺量子位

24. 又一家AI芯片公司:另辟蹊径挑战英伟达

又一家AI芯片公司:另辟蹊径挑战英伟达 又一家AI芯片公司:另辟蹊径挑战英伟达半导体行业观察1771566021 公众号记得加星标⭐️,第一时间看推送不会错过。向一组 AI 张量引擎添加大容量 SRA
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章