24人团队造出速度超英伟达B200近10倍的AI芯片,试图重塑芯片与模型的关系,大幅降低推理成本与功耗。
智能速览
Taalas将模型参数直接刻入晶体管,突破显存带宽瓶颈
实测Llama 3.1 8B生成速度达每秒17000 Token,远超英伟达B200
构建成本降低20倍,功耗降低10倍,但缺乏第三方验证
创始团队源自AMD与英伟达,仅用3000万美元研发出首代产品
面临模型更新迭代快与资金规模小的双重挑战
精华内容
探讨芯片如何从“万能播放器”进化为将模型刻入硅基的专用载体。
范式转变
英伟达GPU推理犹如用火箭送外卖,虽功能强大但成本极高。Taalas采用截然不同的路径,将模型学到的知识直接用晶体管物理结构表达。传统芯片像播放器从显存读参数,而Taalas将音乐刻进唱片本身,彻底解决读取算的循环瓶颈,从而实现极致能效比。
性能实测
Taalas单卡200瓦运行Llama 3.1 8B,每秒生成17000个Token。对比之下,英伟达最新B200约为1800,Groq约为2200。Taalas宣称构建成本降低20倍,功耗降低10倍。即便数据打个折,其数量级差距依然显著,目前官方已开放Demo体验。
现实隐忧
目前性能数据均为Taalas自测,缺乏第三方机构基准验证。模型更新如从Llama 3.1到4,虽官方称仅需改动两层金属光罩且耗时两个月,但牺牲了GPU的灵活性。企业更看重稳定可控,这一策略能否被市场广泛接受尚存疑。
赛道风云
Taalas融资仅2亿美元,不及英伟达两周研发预算,容错率极低。但专用推理芯片已成趋势,英伟达已斥资2亿收购Groq封堵漏洞。若推理成本降一个数量级,秒级响应AI与本地AI应用将被彻底释放,英伟达面临的并非单点竞争,而是整条新赛道的挑战。
24人或许难以颠覆巨头,但AI芯片的范式裂缝已现。若推理成本真能大幅下降,将会催生哪些全新的应用场景?