性能超英伟达50倍,Taalas融资1.69亿,用“一次性”芯片挑战霸主

源自10位全网作者

02-23 07:38

近期,一家名为 Taalas 的芯片初创公司宣布成功融资,计划利用这笔资金研发专用 AI 推理芯片,其独特的技术路线和惊人的性能数据,对由英伟达主导的现有 AI 算力格局构成了潜在挑战,引发了业界的广泛关注。

Taalas 公司由多位曾在 AMD、英伟达和 Tenstorrent 担任核心职位的资深芯片专家创立,其创始人 Ljubisa Bajic 更是知名 AI 芯片公司 Tenstorrent 的联合创始人。这支经验丰富的团队选择了一条与当前主流截然不同的技术路径。目前,以英伟达 GPU 为代表的通用 AI 芯片占据市场主导地位,其优势在于灵活性和成熟的软件生态。然而,这类芯片遵循计算与存储分离的架构,在处理大模型时,数据需要在计算单元和高带宽内存(HBM)之间频繁搬运,这一过程消耗了大量时间与功耗,形成了所谓的“内存墙”瓶颈。为了解决此问题,行业投入巨资研发先进封装、高速互联和液冷散热等技术,使得系统愈发复杂和昂贵。

Taalas 的核心理念是“模型即计算机”,旨在从根本上消除“内存墙”。其首款产品 HC1 芯片采用了一种极端专用的设计思路:通过掩模只读存储器(Mask ROM)工艺,将特定 AI 模型(如 Meta Llama 3.1 8B)的权重参数直接“刻录”或“固化”在芯片的硅片上,与计算逻辑融为一体。这种存算合一的设计彻底抛弃了外部的 HBM,避免了大规模数据搬运,从而在性能和能效上实现了巨大突破。

性能超英伟达50倍,Taalas融资1.69亿,用“一次性”芯片挑战霸主

根据 Taalas 公布的数据,其 HC1 芯片在运行 Llama 3.1 8B 模型时,单用户推理速度可达每秒 17000 个 token,是英伟达最新 Blackwell 架构 GPU 的近 50 倍,也远超其他 AI 芯片初创公司的产品。同时,其成本据称仅为同等性能 GPU 方案的二十分之一,功耗也大幅降低,一个搭载十颗 HC1 芯片的服务器可采用传统风冷散热。此外,该公司还模拟了通过 30 颗芯片集群运行拥有 6710 亿参数的 DeepSeek R1 模型,展示了其架构扩展至更大模型的潜力。

性能超英伟达50倍,Taalas融资1.69亿,用“一次性”芯片挑战霸主

然而,这种极致专用化也带来了显而易见的局限性:灵活性几乎为零。一块 HC1 芯片只能运行其固化的特定模型,无法升级或更换。在 AI 模型快速迭代的今天,这种设计意味着芯片可能很快过时,成为“电子垃圾”。这正是 Taalas 路线的最大风险,也是此前少有公司敢于尝试的原因。

面对这一挑战,Taalas 提出了相应的解决方案和商业逻辑。他们借鉴了“结构化 ASIC”的思路,通过仅修改芯片的少数几层掩模来适配新模型,并声称能将从模型到芯片的生产周期缩短至两个月。Taalas 的目标市场并非需要频繁更换模型的研发阶段,而是大规模部署阶段的垂直应用场景。对于智能客服、车载助手等需要长期稳定运行单一模型的业务而言,极致的成本和能效远比灵活性更具吸引力。当一个模型被验证足够成熟且应用广泛时,为其定制专用芯片在经济上是可行的,节省的推理成本足以覆盖芯片的制造费用。

Taalas 的出现,意味着 AI 芯片市场可能走向分化。未来,算力市场或将形成“通用 GPU + 专用 AI 芯片”的混合格局:以英伟达为首的通用算力继续主导需要灵活性的模型训练和前沿探索;而对于那些已经成熟并大规模部署的AI应用,以 Taalas 为代表的专用芯片将凭借其在成本和效率上的巨大优势,开辟出一个全新的细分市场。这不仅为初创公司提供了一条避开与巨头正面竞争的差异化路径,也为企业用户提供了更精细化的算力选择,最终可能重塑 AI 推理市场的竞争生态。

内容由AI生成

精选参考来源

1. 快50倍省95% 专用AI芯片登场 算力格局生变?

快50倍省95% 专用AI芯片登场 算力格局生变? 快50倍省95% 专用AI芯片登场 算力格局生变?科技思维1771704848 2026年2月,初创公司Taalas推出首款专用AI推理芯片HC1,

2. 又一家AI芯片公司:另辟蹊径挑战英伟达

又一家AI芯片公司:另辟蹊径挑战英伟达 又一家AI芯片公司:另辟蹊径挑战英伟达半导体行业观察1771566021 公众号记得加星标⭐️,第一时间看推送不会错过。向一组 AI 张量引擎添加大容量 SRA

3. 24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token

24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token 24人团队硬刚英伟达,AMD前高管梦之队出手,新芯片每秒17000个token36氪1771652741 造芯片的还有高

4. 初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍

初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍 初创用3000万造不可编程的AI芯片,推理速度是Nvidia最强GPU 50倍DeepTech深科技1771668972

5. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 编辑:定慧今天是大年初六,年还没过完。但有一个新闻却淹没在各种消息中。这可能是今年最重要的AI新闻,但现在依然还没什么

6. 24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token

24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token 24人团队硬刚英伟达!AMD前高管出手,新芯片每秒17000个token量子位1771655102 鹭羽 发自 凹非寺量子位

7. 每秒12000 tokens吞吐:Taalas集群跑DeepSeek R1创速度纪录

每秒12000 tokens吞吐:Taalas集群跑DeepSeek R1创速度纪录 每秒12000 tokens吞吐:Taalas集群跑DeepSeek R1创速度纪录IT之家1771637791

8. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜 GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜新智元1771754976 编辑:定慧

9. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度

把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度 导读:大模型推理速度受限于“内存墙”的硬件限制,那有没有可能,直接把模型这个“软件”,变成硬件本身?也许AI推理的最终答案不是更强

10. 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度

把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度 把模型“刻”在芯片上,定制ASIC芯片跑出17000tps的逆天速度不二小段1771660131 导读:大模型推理速度受限于“内存
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章