24人团队新芯片每秒17000 token,成本降至1/20,挑战英伟达霸权

源自17位全网作者

02-24 07:25

近期,一家仅有24名成员的初创公司Taalas发布了一款名为HC1的新型AI芯片,引发了科技界的广泛关注。这款芯片在运行一个80亿参数的大模型时,据称能达到每秒17000个token的惊人推理速度,远超当前主流AI芯片,同时在成本和功耗上展现出巨大优势。这一突破并非源于更先进的制程或玄妙的物理学,而是来自一种对现有技术路线的颠覆性思考,可能对未来的AI芯片市场格局产生深远影响。

Taalas由曾在AMD、英伟达等公司担任核心职位的资深人士创立。他们推出的HC1芯片,其核心理念可以概括为“芯片即模型”。不同于当前主流的GPU架构,HC1没有选择将AI模型作为软件加载到高带宽内存(HBM)中,在计算时再调取数据。传统方案中,数据在存储和计算单元之间的反复“搬运”构成了所谓的“内存墙”,消耗了大量时间与能源,也是推理速度的主要瓶颈。

24人团队新芯片每秒17000 token,成本降至1/20,挑战英伟达霸权

为了彻底推倒这堵墙,Taalas选择了一条极为激进的专用化路径。他们通过一种类似“结构化ASIC”(专用集成电路)的技术,将AI模型的权重参数直接“固化”或“蚀刻”在芯片的物理电路中。这意味着模型不再是运行在芯片上的“软件”,而成为了芯片硬件本身的一部分。通过将存储与计算融为一体,HC1几乎完全消除了数据搬运带来的延迟和功耗,从而实现了性能的飞跃。据称,其成本仅为同等性能GPU方案的二十分之一,功耗则降低了十倍,一个搭载10颗HC1芯片的服务器甚至可以直接采用传统的空气冷却方式。

24人团队新芯片每秒17000 token,成本降至1/20,挑战英伟达霸权

这种极致的专用化设计在带来惊人效率的同时,也带来了显而易见的代价:灵活性的丧失。HC1芯片一旦制造完成,就终身绑定了其固化的特定模型(目前是Llama 3.1 8B)。如果模型更新换代,这块芯片就可能沦为“电子垃圾”。这在大模型技术日新月异的今天,无疑是一个巨大的风险。历史上,无论是3dfx的Voodoo显卡,还是针对特定CNN算法的AI芯片,都曾因固化设计无法适应技术迭代而被市场淘汰。

然而,Taalas及其支持者认为,如今的市场环境已有所不同。Taalas声称其独特的制造流程可以将“模型到芯片”的周期压缩至两个月,通过仅修改芯片的少数几层掩模,快速为新模型定制芯片,这在一定程度上缓解了产品过时的风险。从经济角度看,当一个大模型的训练成本高达数亿甚至数十亿美元,其后续的推理应用市场将更为庞大。若能通过专用芯片将推理成本降低一个数量级,那么为成熟且广泛应用的“稳定版”模型定制芯片,在商业上是完全划算的。随着行业发展,部分模型可能会像视频编码标准(如H.264)一样,拥有较长的生命周期,为专用芯片的生存提供了土壤。

Taalas的出现,对AI芯片市场的影响是多维度的。它并非要直接取代英伟达等巨头主导的通用GPU市场,而是在AI推理这一特定领域,开辟了一条新的赛道。这可能导致未来AI硬件市场的进一步分化:

一方面,以英伟达GPU为代表的通用算力平台,将继续在模型研发、训练以及需要高度灵活性的前沿推理场景中扮演核心角色。其强大的CUDA生态和通用性是短期内难以撼动的护城河。

另一方面,以Taalas为代表的专用芯片(ASIC)方案,则可能在成本和能耗极度敏感的大规模部署场景中找到自己的位置。对于那些拥有稳定核心模型、追求极致性价比的垂直应用,如智能客服、内容审核、物联网设备等,这种“一次性”芯片将极具吸引力。

更重要的是,HC1所展示的亚毫秒级延迟,为AI应用的形态带来了新的想象空间。当前许多AI智能体(Agent)因交互延迟而体验不佳,而近乎零延迟的响应速度,可以让AI具备进行多步、实时、复杂思考与决策的能力,从而催生出真正流畅的对话机器人、反应迅捷的具身智能以及更安全的自动驾驶系统。

Taalas用一款产品向市场证明,放弃通用性、追求极致专用化,可以在AI推理领域换取惊人的能效比。这为AI芯片的设计提供了新的哲学,也为众多试图在英伟达主导的市场中突围的初创公司指明了一个可能的方向。未来,AI芯片市场或许不再是通用GPU一家独大的局面,而是通用算力与专用算力并存、互补的混合格局。Taalas的这场豪赌能否成功,还有待市场和时间的检验,但它无疑已经为AI硬件的发展撕开了一道新的口子。

内容由AI生成

精选参考来源

1. 24人团队硬刚英伟达!AMD前高管梦之队出手,新芯片每秒17000个token

24人团队硬刚英伟达!AMD前高管梦之队出手,新芯片每秒17000个token 鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI造芯片的还有高手?刚刚推出的一款最新芯片,直接冲上硅谷热榜。峰值推理

2. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 编辑:定慧今天是大年初六,年还没过完。但有一个新闻却淹没在各种消息中。这可能是今年最重要的AI新闻,但现在依然还没什么

3. 24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token

24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token 24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token36氪1771652741 造芯片的还有高

4. 24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token

24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token 24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token量子位1771655102 鹭羽 发自 凹非寺量子位

5. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜新智元1771754976 编辑:定慧

6. 24 人团队研发新芯片每秒 17000 个 token,将对 AI 芯片市场带来哪些影响?

24 人团队研发新芯片每秒 17000 个 token,将对 AI 芯片市场带来哪些影响? 第一反应不是”哇好快”,然后”等等,才24个人?”,牛逼。关注芯片的领域的人可能会了解的多一点,一颗台积电6

7. 芯片初创公司 taalas 融资 1.69 亿美元研发 AI 芯片挑战英伟达,这意味着什么?

芯片初创公司 taalas 融资 1.69 亿美元研发 AI 芯片挑战英伟达,这意味着什么? 看到回答区不少人没仔细看这家公司的核心技术,以为又是一个做asic的普通公司,实际上他们的核心技术来自于他

8. #ai芯片##英伟达##AMD# 造芯片的还有高手?刚刚推出的一款最新芯片,直接冲上硅谷热榜。峰值推理速度高达每秒170...

#ai芯片##英伟达##AMD# 造芯片的还有高手?刚刚推出的一款最新芯片,直接冲上硅谷热榜。峰值推理速度高达每秒170... 造芯片的还有高手?刚刚推出的一款最新芯片,直接冲上硅谷热榜。峰值推理速

9. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度

把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度 导读:大模型推理速度受限于“内存墙”的硬件限制,那有没有可能,直接把模型这个“软件”,变成硬件本身?也许AI推理的最终答案不是更强

10. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度

把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度不二小段1771660131 导读:大模型推理速度受限于“内存

11. 1.69亿融资押注专用芯片:Taalas要靠“去GPU化”改写AI算力格局

1.69亿融资押注专用芯片:Taalas要靠“去GPU化”改写AI算力格局 1.69亿融资押注专用芯片:Taalas要靠“去GPU化”改写AI算力格局钛媒体APP1771811435 2026年2月2

12. 快50倍省95% 专用AI芯片登场 算力格局生变?

快50倍省95% 专用AI芯片登场 算力格局生变? 快50倍省95% 专用AI芯片登场 算力格局生变?科技思维1771704848 2026年2月,初创公司Taalas推出首款专用AI推理芯片HC1,

13. 【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1 8B整个模型和参数直接蚀刻到硅片上。不用显存,不...

【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1 8B整个模型和参数直接蚀刻到硅片上。不用显存,不... 【把大模型直接刻进芯片里】Taalas搞了个狠活:把Llama 3.1

14. 这是要出大事了。。。

这是要出大事了。。。 这个春节,有个叫Taalas的芯片新公司横空出世,它干了一件让英伟达震惊的事情:直接把大模型装在芯片面上。。。这样什么内存带宽限制之类都不存在了。。。而且性能非常夸张:在这块专用

15. 芯片初创公司 taalas 融资 1.69 亿美元研发 AI 芯片挑战英伟达,这意味着什么?

芯片初创公司 taalas 融资 1.69 亿美元研发 AI 芯片挑战英伟达,这意味着什么? 历史上半导体行业可以找到两个比较类似的例子:Voodoo:老玩家都知道,90 年代末 3dfx 的 Voo

16. 初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍

初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍 初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍DeepTech深科技1771668972

17. 一个疯子,造出便宜100倍的AI芯片

一个疯子,造出便宜100倍的AI芯片 一个疯子,造出便宜100倍的AI芯片傅盛1771838166 25个人,3000万美金,两年半。做出了一块碾压英伟达旗舰GPU 10倍的芯片。不是PPT,不是实验
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章