9月收官的云栖大会上,英特尔把下一代至强 Diamond Rapids(至强 7)摆上了展台:最高 256 个核、1.28GB L3 缓存,官方的说法是,这是一颗为 Agent 时代重新设计的处理器。 但混在展台前的硬件媒体和 UP 主们,讨论最凶的其实是规格表角落里那行几乎没人第一眼看见的小字——没有超线程。哔哩哔哩
在技术圈把上一代 Granite Rapids 到这一代逐项列出的十六项对照表里,通道数、频率、缓存、PCIe、CXL、UPI 全是加法,唯独超线程一栏从"有"变成了"取消"。 这一下把整个评论区吵翻了,最直觉的两派:一派喊"牙膏厂倒吸牙膏",一派跟着热评玩梗"缓存大到能装系统了"。两派其实都把这个产品想简单了。这篇就把这行小字拆开:为什么砍、砍掉换来了什么、跟你有没有关系。知乎
先对一张数:唯一的减法有多大
Hot Chips 2026 上英特尔进一步公开了资料,最大核心数确认就是 256 核,而不是先前传的 192 核;这颗芯片的目标上市时间,口径是 2027 年年中。知乎
把两家的上一代和这一代四个型号摆一排,线程数的走向一目了然:
型号 | 大核数 | 线程数 | 超线程 |
|---|---|---|---|
Intel Granite Rapids(上代) | 最高 128 P 核 | 256 | 保留 |
Intel Diamond Rapids(本代) | 最高 256 P 核 | 256 | 硬件层面取消 |
AMD Turin(上代) | 128(Zen 5)/ 192(Zen 5c) | 256 / 384 | 保留 |
AMD Venice(本代) | 256 | 512 | 保留 |
英特尔一代之内核心数翻倍、线程数原地不动;AMD 则从 384 涨到 512,线程数排成一行就是 256、256、384、512。 更扎眼的是,两家第一次在核心数上站到了同一条线:都是 256——但 AMD 的 256 核是双倍线程的卖点,英特尔的 256 核是一列"取消"注脚换来的。知乎
而且"没有超线程"不是 BIOS 里关掉的选项:Panther Cove 核心里就没有第二套架构寄存器,没有 T0/T1 的概念,硬件层面根本不做这件事。知乎
为什么砍:三种解释,流传最广的那种只对一半
超线程当年的卖点是"花一份钱买两份算力",理想负载下 1.2~1.8 倍吞吐、不占额外核心面积。到核心最多的这一代反而不要了,社区里流传三种解释,可信度并不一样:
“核心做宽了,SMT 收益变小”。 流传最广,但只对一半:Panther Cove 的解码宽度和乱序窗口确实更大,执行单元空转更少;可 AMD 的 Zen 5 同样是宽度优先的设计,乱序窗口不比它小,超线程照开。这个说法能解释收益为什么下降,解释不了为什么必须砍。
面积和功耗。 每多一条线程就要多一套寄存器堆、重命名和退休逻辑,单颗没多少,乘以 256 就不是小数。省下的预算要么把核做更宽,要么让 650W 量级的功耗盘子装得下 256 个核——注意,这个数字来自公开报道,Intel 未在发布会上官宣。知乎
验证成本。 2018 年那批侧信道漏洞之后,SMT 长期是数据中心安全评审的常客,不少云厂商部署时直接关掉——硬件给了两条线程,实际用成一条。硬件不支持,等于替整个生态把这个决定做了。
值得留意的是,Hot Chips 讲义把 256 核和 1.28GB 缓存放在最显眼的位置,"无 SMT"只占规格表角落几个字——这家公司从不错过任何可讲的卖点,这次对超线程的沉默本身就是信息。知乎
技术圈还有一种判断:超线程会在下下一代 Coral Rapids 上回来——如果砍掉它纯属技术进步,就没理由隔一代再捡起来。 这说明这一代的取舍是为这一代的约束服务的,不代表"超线程过时了"。这不是官方口径,但它比"挤牙膏倒退"的读法诚实得多。知乎
1.28GB 缓存装不下你的大模型,但装得下 Agent 的命根子
B 站云栖视频下最热门的评论(56 个赞)说,以后整个 128G 缓存、模型直接加载到三缓、显卡卒。 这条恰恰是最该被纠正的:L3 是 SRAM,容量按 MB 级设计、断电即失,装不了模型权重——一个 7B 模型 FP16 光权重就要 14GB,1.28GB 连零头都不够。哔哩哔哩
超大缓存真正伺候的,是 Agent 负载里最贵的东西:延迟。一个智能体几秒钟内完成思考、检索、规划、执行,背后是多次模型调用和海量数据访问;上千个智能体并发时,真正的瓶颈不是算力而是访存延迟,KV cache 和 RAG 检索的热数据要反复命中同一块缓存。英特尔在云栖上给至强的角色定义说得很直白:在 GPU 集群里它是机头 CPU,在 CPU 集群里它是承担任务编排、推理调度的核心枢纽,在存储集群里它让海量信息被快速调用和持续记忆。知乎
跟阿里云合作的 Agentic Browser 项目给了同一逻辑的另一组数字:双方基于官方 Chromium 技术体系对 Blink、V8 等核心引擎做轻量化优化,再叠上 AVX-512 和芯片内置的 IAA、QAT 硬件加速器,联合优化方案可减少约 30% 的内存开销——这才是"为 Agent 时代重新设计"的落地样本,而不是把模型塞进缓存。知乎
而这一代真正的重头戏,规格表里写得其实比缓存更狠,只是没人聊:
内存带宽两级跳。 从上一代至强 6 的 12 通道 DDR5-6400(MCR 能到 8800),这一代直接跳到 16 通道、DDR5-8000、MRDIMM-12800 档,峰值带宽从约 0.6TB/s 抬到 1.6TB/s。 AMD 的 Venice 也在同一步跨进 16 通道、同样 1.6TB/s——这一代两家规格表的相似度,比过去任何一代都高。知乎
22 颗裸片拼一颗 CPU。 一块基板上铺 16 颗计算芯粒、4 块基础模块、2 颗集成内存与 I/O 中枢;缓存不在核心芯粒上,而在下面那层 Base Tile 里,靠 3D 交叉开关连上去,开盖图和 AMD EPYC 已经有了几分神似。 工艺按层混搭:核心芯粒 18A-P、基础模块 Intel 3-T、Fabric Hub 用 Intel 3。知乎
内存控制器从计算芯粒里整体搬出去,所有访存经过 IMH 中枢调度,地址解码也归中枢管——这套"轮毂-辐条"结构才是这代的分水岭。这件事 AMD 从 2017 年的 Naples 就在做,英特尔这一代才走到同一个位置。知乎
还有一个容易被忽略的点:开机内存训练不再让 x86 核亲自跑。至强 7 新增了一颗专职 MMC 微控制器,把训练从 BIOS 手里接过去;AMD 则从 Zen 1 起就交给了片上 ARM 的 PSP。两家在同一个环节收敛,只是落点不同。知乎
AMD YES 还是 Intel 翻身?现在下结论都早
两家规格表越来越像,差异反而集中在三处,而且每处都是没有标准答案的赌注:
互连路线。 Intel 的 UPI 3 从 24GT/s 跳到 56GT/s,而且不向下兼容前代 UPI、也不兼容 CXL,升级就是整体换代;AMD 的 xGMI3 维持在 32GT/s,Venice 上只做增强,给客户留了渐进升级的路。 这是对多路服务器市场两种完全不同的判断。知乎
封装路线。 Intel 用 3D 混合键合赌性能上限,AMD 用传统 MCM 平铺换良率和成本确定性——超大规模出货面前,一边赌的是性能天花板,一边赌的是爬坡速度。
工艺路线。 至强 7 核心芯粒用自家 18A-P,公开数据是同功耗性能提升约 9%、或同性能功耗降低约 18%,设计规则与 18A 兼容;Venice 的 CCD 用台积电 N2,成为首个量产 2nm 级 x86 服务器芯片。 决定 2027 年数据中心格局的,很可能不是架构,是这两条产线的良率和产能。知乎
还有一条事实闸门必须先立住:AMD 公布的 Venice 数字全部是自家实测、没有提交 SPEC,也就没有第三方验证;至强 7 这边更早,还处在文档修订阶段,连主频和完整功耗规格都没官宣。 现在任何一边喊"赢了",都是在给没验过的货定价。知乎
跟装机、捡垃圾、买云的你,各有多大关系
普通云用户:不用认识芯片型号,但 Agent 实例的价格跟你有关。搭载至强 6 的阿里云第九代 ECS 实例 g9i 已经上线,官方口径性能较上代最高提升 20%;DMR 的目标上市时间是 2027 年年中,云上实例通常还要再晚一段时间才摆进价格页——等两家正面竞价,AI 推理实例的降价窗口才会真正打开,这是这颗服务器芯片传导到你钱包的最短路径。知乎
homelab 和垃圾佬:评论区"十年后闲鱼 50 包邮"是 E5 v3"十块 i7"黄金时代的肌肉记忆,但 DMR 的垃圾佬窗口远得很:UPI、CXL 不向下兼容意味着主板强制换代,MRDIMM 市面稀缺、板子注定不便宜,650W 量级的热量普通风冷也接不住。二手市场真正先降价的,大概率是至强 6 这一代和现役老 EPYC。如果手头就有双路老至强,社区里已经有人在双路老至强、125GiB 内存加一张 RTX 3060 的机器上完成了大模型的本地推理工程验证——老平台玩轻量 Agent 是被验证过的,但这跟等 DMR 是两回事,别为了"等颗新至强"去搭新平台。知乎
桌面装机党:别把两条线搅在一起。桌面这边 Nova Lake 的公开传闻是超线程要回来,服务器这边 DMR 把它砍了——消费端和数据中心约束不同、做法相反,恰好是"这一代取舍为这一代约束服务"最好的注脚。刷到"服务器旗舰都放弃超线程了,桌面回归是倒退/是进步"这类自媒体结论时,回头看看第一节那张表,基本就不上头了。
最后盯四个信号,别的先不用急
SKU 表:官方主频、TDP 正式公布,验证 650W 传闻是否属实;
SPEC 成绩:两家提交第三方跑分之日,才是线程模型分出高下之时;
Coral Rapids 的超线程去留:如果隔代回归,坐实"这一代是为制程约束做的减法";
云厂商动作:阿里云们什么时候把 DMR 实例摆上价格页——那才是这颗芯片跟你账单第一次产生关系的时刻。
至于 1.28GB 缓存能不能"把系统装进三缓"这种梗,当乐子就好。内存墙这个问题,英特尔的答案从来不是把内存塞进 CPU,而是把内存通道、互连和调度体系整个重排了一遍——省下来的超线程,最后变成了更宽的核心、更干净的拓扑和更可预测的延迟。看懂这个,比站队"AMD YES"或"Intel 翻身"都值钱。