6亿美元买一张AI推理船票,AMD把模型刻进芯片:性能73倍、成本二十分之一

源自62位全网作者

08:42

内容由AI生成

精选参考来源

1. AMD 收购 AI 芯片初创公司 Taalas:将 AI 模型直接硬编码进芯片。 AMD本周宣布已达成收购协议,将收购总部位于多伦多的 AI 推理芯片初创企业 Taalas。Taalas 的加速器并非通用芯片,而是针对单个 AI 模型做定制化、硬件硬连线设计。 牺牲通用性的代价之下,Taalas 这项技术可以打造成本更低的芯片。该公司称,针对特定模型,芯片输出速度相比传统 GPU 能够提升数千倍。AMD 方面拒绝披露本次交易的收购金额。Taalas 自2023年成立以来,累计完成 2.19 亿美元风险融资。 Taalas 现有芯片可运行 Meta 的 Llama 3.1 小版本模型,同时公司正在研发适配更大、更先进模型的芯片产品。该芯片采用台积电较成熟工艺制造,芯片内置高速 SRAM 存储器。

2. AMD重磅收购:全新AI芯片——模型权重直刻硅片!推理吊打英伟达

3. AMD收购Taalas:加码AI推理 全栈AI再添重要拼图

4. 刚刚,AMD收购一家AI芯片公司!24人打造6nm推理芯片刷屏硅谷

5. AMD收购AI芯片初创公司Taalas 模型直接蚀刻硅片

6. 定制化GPU ,ai算力卡 ,把模型直接写死再芯片上 Taalas:把大模型“焊死“在芯片里的加拿大公司

7. Taalas 芯片级 AI,实现 1.7万Token每秒推理,回复速度快的惊人

8. AMD 宣布计划收购 Taalas 公司,补强 AI 推理芯片路线图

9. AMD收购AI推理芯片厂商Taalas

10. 强攻AI推理!AMD收购一家AI芯片公司

11. AMD收购Taalas:AI算力的破局信号

12. AMD吞下Taalas,A股推理芯片圈谁先尝到甜头?

13. AMD收购AI推理芯片商Taalas,完善数据中心集成战略

14. 苏姿丰ASIC布局又+1:AMD官宣收购Taalas 押注“模型即计算机”赛道

15. 科技巨头集体押注自研芯,AI芯片战场正加速向推理端迁移

16. AMD收购AI推理芯片初创公司Taalas,加码布局“后GPU时代”

17. AMD(AMD.US)收购AI推理芯片初创公司Taalas 完善数据中心产品矩阵

18. 【AMD硬核“刻录”AI:当模型变成芯片,Token将廉价如电力】AMD近日收购了初创公司Taalas,其核心技术是将大模型的权重直接“刻”进硅片,制造出模型专用集成电路(MSIC)。这种做法彻底颠覆了传统GPU通过显存读取权重的逻辑,实测在Llama 3.1 8B模型上跑出了每秒近1.7万个Token的惊人速度,比顶级GPU快了近50倍。虽然硬件固化意味着模型大改需要重新流片,但Taalas通过优化工艺降低了改版成本,试图在推理效率上实现量级跨越。这标志着AI正在从算法竞赛转向基础设施的“硬化”阶段。当权重被固化在硬件里,Token就从昂贵的稀缺资源变成了廉价的工业品。社区评论里有个比喻很到位:这就像从拨号上网跨越到光纤宽带,速度的量变会引发应用形态的质变。如果推理几乎瞬时且低功耗,开发者将不再纠结于单次对话的精准度,而是能通过成百上千个子智能体进行高频迭代和自我修正,用“暴力推理”解决复杂问题。这不仅是AMD绕开Nvidia显存带宽瓶颈的奇招,也为手机等终端设备内置高性能本地模型提供了物理可能,真正的个人AI助理或许就藏在这些被固化的硅片里。

19. AMD官宣收购Taalas,AI推理赛道迎来大变局

20. 朋友买股票问我AMD怎么看? 上次聊完英伟达之后,朋友隔了两周又来找我。这次他明显做了一点功课,上来就说:“我看了下,AMD 好像也有 AI 芯片?叫 MI 什么的东西。那它能不能跟英伟达掰掰手腕?” 我说:“能,但是得看你怎么定义‘掰手腕’。” 他问什么意思。我说:“你想象一下,英伟达像个富二代——要钱有钱,要资源有资源,周围所有人都捧着他。AMD 呢,像个创业公司,东西做得不差,但就是缺人缺生态缺信仰。你要说硬件能不能打——能打。但你要说‘我买回来插上就能跟英伟达一样爽’——那可能还要再等等。” 他皱着眉头说:“那不就等于不能打吗?” 我说:“别急,故事没这么简单。” 先讲硬件。 AMD 这几年在 AI 加速卡上确实不是吃素的。MI250、MI300 系列,尤其 MI300X,规格堆得非常狠。192GB 的 HBM3 显存,什么概念?英伟达 H100 是 80GB,H200 才提到 141GB。单看显存容量,AMD 甚至反超了。对于大模型推理来说,显存大就意味着你能塞下更大的模型、更长的上下文,或者同样的模型你用更少的卡跑——这直接省钱。 我有个朋友在某个超算中心干活,他们那边部署了一套 MI300X 的集群。他跟我说,跑 Llama 2 70B 推理的时候,单卡就能塞下,批处理吞吐量很漂亮。相比之下,H100 得用两张卡才能舒服地跑同样规模。所以如果你主要是做推理,尤其做大模型部署,AMD 的性价比是真的香。 训练呢?也不差。FP16 算力、BF16、FP8 这些关键指标,MI300X 基本追平甚至略超 H100。而且 AMD 走的是“CPU+GPU”融合路线,他们家的 Epyc 处理器配上 Instinct 加速卡,在机群通信上可以做很多优化。这在 HPC(高性能计算)领域——比如气象模拟、流体力学、分子动力学——是实打实的优势。 但问题来了。 “纸面数据”漂亮,不代表你上手就舒服。有朋友做过一个特别蠢的实验:去年有个小项目,想在 AMD 上跑一遍对比结果。她花了一整个下午装驱动、配 ROCm(AMD 的 CUDA 替代品)、编译 PyTorch。结果跑第一个 demo 的时候,报错说某个算子不支持。后面查了一下,那个算子在 CUDA 上早就优化好了,在 ROCm 上得用另一个写法。又花了半天改代码。 最后跑通了,速度还不错,但时间没了。 朋友听到这里笑了:“那她这不等于帮 AMD 打工吗?” 我说:“对。所以普通用户或者小团队,不会这么折腾。大家要的是‘啪一下就能跑’。这就是英伟达最狠的地方——不是算力,是省心。” 这就引出了那个绕不开的话题:软件生态。 CUDA 这个东西,做 AI 的人都知道。你装好驱动,torch.cuda.is_available() 返回 True,然后你就可以把模型.to(‘cuda’),剩下的事它帮你搞定。所有主流框架——PyTorch、TensorFlow、JAX——底层全是 CUDA。你要写自定义算子?CUDA C++ 写起来繁琐,但文档齐全,社区问答多,Stack Overflow 上什么坑都有人踩过。 AMD 的 ROCm 呢?这几年进步确实大。从 ROCm 5.x 到 6.x,支持的范围越来越广,PyTorch 官方也提供了 ROCm 版本。但你要说“无缝体验”,还差一截。 举个例子。你跑一个 Hugging Face 上的 Transformer 模型,用 CUDA 基本上直接跑。用 ROCm,大概率也能跑——但如果是比较新、比较冷门的模型,或者用到了一些特殊的融合算子,就可能出问题。你去看 GitHub issues,经常见到“ROCm 上这个 kernel 编译失败”“某个 attention 实现在 ROCm 上比 CUDA 慢 30%”之类的帖子。 然后你怎么办?要么等社区修,要么自己改。自己改的话,你要懂 HIP(AMD 的 CUDA 转译层),那又是一个学习成本。 所以目前 AMD 的生态状态,总结一下:能用,但不爽;在进步,但不快;社区活跃,但规模差了一个数量级。 我朋友问:“那有没有可能有一天 AMD 追上?” 我说:“理论上可能。但你要知道,CUDA 发展了快二十年,积累了无数闭源和开源代码、工具、库、习惯、教程。这玩意儿不是光靠砸钱就能超的——它更像一种语言。你说英语难学吗?对中国人来说不简单,但全世界都在说,你绕不开。你非要发明一门新语言,语法更优美,发音更规则,但没人说,那有什么用?” 他沉默了一下,说:“那 AMD 不就是个备胎?” 我想了想,说:“备胎这个词不太对。应该叫‘另一个选项’。而且这个选项在某些场景下,其实更合适。” 什么地方更合适? 第一,HPC 和科学计算。很多超级计算机用的是 AMD CPU,配上 AMD GPU 可以做到极致的内存一致性优化。这类用户不追求“最新 AI 模型秒级部署”,他们追求的是长期稳定的运行、可预测的性能、以及预算友好。AMD 在这块确实有优势。 第二,预算敏感的大规模推理。如果你要部署一个服务,每天处理百万级请求,卡的数量直接决定成本。MI300X 单卡显存大,意味着你可以用更少的卡跑更大的 batch,单位 token 的成本更低。AWS、Azure 上现在都有 MI300 实例,一些做 AI 推理服务的创业公司已经开始切一部分流量过去了。 第三,开源社区驱动的用户。有些人就是不想被锁死在英伟达生态里——可能是出于技术理想,可能是为了供应链安全,也可能就是喜欢折腾。ROCm 是开源的,你甚至可以自己编译、自己改 kernel。这种自由度,英伟达给不了。 我朋友说:“那听起来也不是一无是处。” 我说:“当然不是。你要把 AMD 说得一文不值,那它市值两千多亿美金是天上掉下来的?问题是,你得接受它目前的不完美。” 说到这里,我想起上次聊英伟达时提到的一个观点:他们搞算法的人,其实一直在做“降低单位智能所需算力成本”这件事。这个逻辑对 AMD 来说同样适用,甚至更关键。 为什么?因为 AMD 目前的处境是:算力不差,软件生态稍弱。那如果你能用算法层面的优化,减少对软件生态的依赖,AMD 的劣势就会被缩小。 比如,你做模型量化——把 FP16 压到 INT4。很多算子优化其实是在编译层完成的,不一定要依赖 CUDA 特有的库。AMD 的 ROCm 里也有类似的推理优化工具,比如 MIGraphX。如果你把模型量化的足够轻量,算子的复杂度足够低,那 CUDA 和 ROCm 的差距就没那么大了。 再比如,你做算子融合。把好几个小操作合并成一个大的 kernel,减少 kernel launch 开销。这种优化很多时候是在框架层(比如 PyTorch 的 inductor)或者编译层(比如 TVM、MLIR)完成的。只要 AMD 的硬件支持这些指令,你写出来的优化代码两边都能跑。 看过一篇论文,讲的是在固定推理延迟下,用 AMD MI250 跑优化过的量化模型,和用 H100 跑原始精度模型,前者的能效比居然更高。说明算法优化可以在一定程度上“抹平”硬件和生态的差距。#AMD#苏姿丰#英伟达#CPU #美股

21. #AI论道# 【AMD 宣布收购 AI 推理芯片初创公司 Taalas,补强推理路线图】大模型之家讯 8月7日,AMD 发布公告,宣布计划收购面向 AI 推理的芯片初创公司 Taalas。Taalas 针对单一 AI 模型定制芯片,牺牲通用性换取更低成本与更高输出速度,其基于 Meta Llama 3.1 打造的推理芯片采用台积电成熟工艺与高速 SRAM,特定型号输出速度比传统 GPU 快数千倍。自 2023 年成立以来,Taalas 累计融资 2.19 亿美元。AMD 未披露交易规模,此举将补强其 AI 推理芯片路线图,与英伟达在推理市场的竞争进一步白热化。 #AMD# #芯片#

22. AMD宣布收购AI推理芯片企业Taalas

23. AMD宣布收购芯片初创公司Taalas,强化AI推理布局

24. AMD收购Taalas,将AI模型直接固化到芯片中

25. AMD收购AI推理芯片初创Taalas,特定大模型推理速度达传统GPU千倍

26. AMD收购AI推理芯片公司Taalas,AI芯片巨头走向异构计算

27. AMD收购AI推理芯片初创公司,AI推理芯片成行业竞争新焦点

28. 【AI企业动态】AMD 宣布计划收购 Taalas 公司;GPT-4.5 以来训练的最大模型;古尔曼爆料 OpenAI 首款 AI 硬件

29. 把AI模型焊死在芯片里?AMD收购这家奇葩初创公司到底图什么 | TechTechPotato

30. AMD收购AI推理芯片公司Taalas,强化推理市场布局,科创芯片ETF博时(588990)涨超2%,冲击4连涨

31. 2026年8月7日 科技与编程热点速览

32. Taalas大模型芯片,速度比英伟达快。加拿大 24 人公司 Taalas 发布革命性芯片:推理速度是英伟达 H200 的 50 倍,成本降 20 倍,功耗降 10 倍。 核心创新 - Model-Based Chip:把大模型参数物理焊死在晶体管里,不是加载到内存运行 一块芯片只能跑一个模型,换模型需换芯片 目前已实现 Llama3.1 8B,推理速度达 17000 token/秒(H200 约 230 token/秒,Groq 约 2000 token/秒) 实测体验:秒出回复,2000 字无蹦字过程,回复质量目前较拉跨(官方声称是 demo 模型)。 这是专业领域大模型未来的低成本解决方案吗? #大模型 #人工智能发展 #芯片 #AI #科技前沿与未来

33. 2026英伟达GTC:“推理之王”的ASIC反击战与Token经济学【硅谷101】

34. 芯片大咖访谈:英伟达最怕的不是AMD,而是华为,中国是半导体供应链最全的国家#AI #芯片 #半导体 #英伟达 #黄仁勋

35. 铭凡 N5 MAX 首发评测!这才是真正的AI(O) NAS!120W 满血释放,16核32线程,本地AiAgent + 本地视频生成

36. 戴密斯:AI最大的瓶颈是算力,AI公司的差距会拉大#谷歌 #戴密斯哈萨比斯 #DeepMind #新药研发 #算力

37. 能跑本地35B模型!铭凡N5 MAX会是AI-NAS的版本答案吗?【钱韦德】

38. “邪修”AI芯片的Taalas,成色如何?|AGI焦点

39. AI CPU推高DDR5溢价,存储芯片“超级周期”或延续至2027年

40. 一夜千亿,反杀英伟达!这家AI芯片公司凭什么炸翻美股?

41. 学习英伟达“好榜样”,谷歌和博通都开始“有样学样”,开启“AI芯片闭环”

42. 盘点一周AI大事(2月22日)|不赚钱拔网线,龙虾狂赚1万 工程师开源龙虾打工人ClawWork,10刀开局,7小时狂赚1万刀 工程师Sigil开源首个全自主智能体The Automaton Kimi上线云端龙虾Kimi Claw 网易开源桌面版龙虾LobsterAI Google上线地表最强大模型Gemini 3.1 Pro Gemini接入音乐模型 Lyria 3 NotebookLM升级,动动嘴就能修改PPT,还支持导出PPTX格式 Anthropic发布Claude Sonnet 4.6 Claude与Figma官宣史诗联动,Claude Code写的页面能一键导入Figma 阿里开源最强行动智能体 Mobile-Agent-v3.5 字节开源极速生图模型BitDance Tavus发布最强数字人模型Phoenix-4 Taalas研发出革命性AI芯片HC1 #抖音年味新知贺岁 #前沿科技趋势发布月 #AI新星计划 #OpenAI #智能体

43. 学习英伟达刺激芯片销售,AMD为“AI云”借款做担保

44. 都想学英伟达“芯片换融资”,谷歌和AMD都要扶持“AI云”

45. “AI弃子”CPU逆风翻盘:英特尔、AMD与ARM意料之外的一场胜利【硅谷101】

46. GPU要凉?前英伟达AMD大神将AI刻在芯片上!17000 tokens/秒屠榜

47. AMD迷你电脑重1.2kg 竟能本地运行2000亿参数大模型

48. 我以为 AMD AI Dev Kit 能平替 NVIDIA,结果第一步就卡在驱动上

49. 告别显存焦虑!AMD锐龙AI实测封神,统一内存打开本地AI新世界

50. 超前点映AMD Advancing AI 2026:AMD AI YES?

51. AMD全栈AI战略解析:从芯片到生态的突破

52. 在厦大读书的时候,电脑用的是英特尔处理器、AMD处理器。我一个学文科的人,对CPU的发展历史都非常了解。全球的焦点都在英伟达,但大大低估了AMD。由于AMD股价长期低迷,导致AMD被大众遗忘了。我的观点,市场严重低估了AMD的服务器和AI加速卡。AI分为两大阶段,前期是大模型训练阶段,英伟达一家独大。下一个阶段是推理阶段,AMD会迎来需求的爆发。AMD不会取代英伟达,但会成为AI行业第二大公司。前不久,我给一个朋友介绍了一家公司通富微电,国内AI芯片的先进封装龙头,针对的是AMDAI芯片。未来AMDAI芯片会随着AMD的景气度重新定价。7月份科技股暴跌,通富微电逆势上涨,证明了我的眼光。

53. AMD的显卡可以!这才是世界应该有的样子! 删掉GGUF!放弃显存分块! 去TMD分步加载!去TMD压缩! BF16 直接上!! 把所有的精力投入创作而不是浪费在调整系统环境和设置各种参数上边。这才是原本应该有的样子。 郁结了N个月的这口气啊·~~ 感谢AMD AI MAX. AMD 可以,20年前用过AMD的CPU,当时的感觉是:性能狂躁,稳定欠佳,耐性一般。刻意本地 confyui 跑了个1080P的视频,机器GPU的核心温度在90多度两个多小时了,一直在撞着它的温度墙去跑,从上边 compute 的运行状态就可以看出来,一运算,温度就更高,于是就停下歇一下,然后降下来再继续跑,这也是为啥这个流可以跑这么久的原因。 环境温度在30度左右。 机器从中午到现在一直在高频稳定运行。 这大大超出我的预料。 加油 AMD 。 #AI #amd #comfyui

54. 2026年,我的AI折腾日记

55. 实测 AMD 才醒悟:苏姿丰逆袭教我打破成见

56. 英伟达台北展 RTX Spark vs AMD AI Max+ 395‌:AI 能力差不多,体验却不同

57. 64G内存也不太够啊[捂脸] 最近在用amd显卡玩ai,文生图,图生视频,视频去水印等都已搞定,现在在把1080p的视频变成4k的,遇到了显存爆表的问题,然后查到amdai加速库xformer,不仅能加速计算,还能明显降显存,简直上福音啊,于是就通过pip安装来xformer。 安装完成查看信息发现仓库里的xformer与我的pytorch版本不匹配,很多功能都不可用,最后只能自己拉git源码编译来了,编译过程较长,然后我就做其他事情去了。过了一会回来查看发现编译错误,内存oom了,把编译并行度降为1,把交换空间改为64G,重新再次编译。 这次盯着屏幕,没过多久发现64G内存已经占用99%了[捂脸]如果再遇到oom就没办法了,只能躺平等仓库里的版本更新了。

58. 【AMD Ryzen AI Halo:是AI开发者的“全家桶”,还是高价溢价的“智商税”?】AMD推出的这款Ryzen AI Halo迷你电脑,搭载了16核Zen 5架构的Max+ 395处理器和128GB统一内存。它最大的卖点不是硬件本身,而是那套“开箱即用”的软件生态:预装了定制的Linux/Windows系统,提供经过验证的“最佳配置(BKC)”和保姆级的AI Playbooks教程,试图彻底解决AI开发中令人头秃的依赖冲突和环境搭建问题。从本质看,这台机器卖的不是算力,而是“时间”和“确定性”。虽然4000美元的价格相比去年翻倍,且256GB/s的带宽在Mac Studio的800GB/s面前显得寒碜,甚至没有CUDA生态加持,但它为非苹果用户提供了一个极其罕见的、拥有超大统一内存的x86开发环境。对于需要本地运行大参数MoE模型、又不想折腾硬件兼容性的开发者来说,它是一个昂贵但省心的“实验台”;但对于追求极致性价比的极客,租用云端算力或DIY多块二手3090显卡依然是更理性的选择。 lttlabs.com/articles/2026/07/06/amd-ryzen-ai-halo #人工智能##AI创造营##AMD##硬件评测##大模型开发#

59. AMD Ryzen AI Halo开箱:128GB统一内存AI工作站来了

60. AMD Ryzen AI Halo与NVIDIA DGX Spark对比

61. AMD 出了个 $4000 的 AI 开发套件,社区说:一半价格才合理

62. AMD推出Ryzen AI Halo开发平台:以3999美元挑战NVIDIA Spark,6个月内自负盈亏

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章