这三天,A卡用户的工作群里同时出现了两种标题。一种来自海外评测圈的转述:跑DeepSeek V4.1 Flash,AMD每美元性能"最多落后42倍",CUDA护城河还在。 另一种出自同一款模型9月10日的技术报告:百万token上下文的常驻显存被压到每token平均约890字节,上一代的四分之一——过去"显存再大也塞不下"的东西,正在塞得下。微博知乎
一个说"别动钱包",一个说"门槛在拆"。中间夹着的,是过去半年被"AI YES"和"没提升"反复拉扯、手里攥着9070XT或者刚看了395小主机的那批人。这轮到底该不该动,得把三本账分开摆。
第一本账:42倍量的是谁的战场
先对信源。9月12日快科技报道的口径是"DeepSeek V4.1 Flash上AMD显卡的性价比输了40多倍"。 微博上按SemiAnalysis数据流传的版本更细:vLLM的CUDA支持在模型发布当天就位,AMD自己的V4.1 Flash镜像两天后才发布;功能上能即开即用,但每美元性能比H200最多差14.8倍、比B200/B300最多差42倍。SemiAnalysis的归因很直接:英伟达和600万开发者生态的合作让CUDA在第一天就完成了优化。知乎微博
关键是量纲。这组数字的主体是数据中心加速卡跑在线推理服务,计价单位是"每美元性能/token",参照系H200、B200、B300没有一张会装进你的机箱——所有流传版本里都没有出现桌面卡型号。所以"42倍"不能读成"我的9070XT变慢了42倍"。

但有一件事确实和每个A卡用户有关:那个"两天时差"。每次新模型发布,CUDA侧第一天就有能用的优化路径,ROCm侧排队——我们之前对完30多条A卡AI实测帖时是"3.3倍"对"没提升"的温差,ROCm 10跳版本凑十周年时说过三个新工具各只帮到一类人,这次的镜像时差是同一个结构性问题的又一次显形。护城河不只看峰值算力,还看"新模型发布后的第一周",这一条是真,不用装看不见。
第二本账:890字节到底在拆什么墙
同一周公开的报告标题就叫《DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression》,把降本写在了脸上。知乎上拆数字的解读里,最值得记的有三行:
1M上下文下,每token常驻HBM的全局KV cache平均约890字节,是上一代V4-Flash的四分之一;落到SSD的持久化缓存降到上一代的八分之一。
拿初代架构硬开1M上下文,单条会话的KV cache约389GB,超过任何一台单机服务器的HBM总量——那个年代百万上下文做不出来,不是贵,是放不下。
现在890B×1M≈890MB,“一块主流加速卡上,权重、激活和这份记忆能同时放下”。知乎
机制一句话能懂个大概:40层主干里前20层做编码器,解码器各层的全局记忆不再逐层自己算,而是从编码器末层隐状态经投影矩阵生成,prefill开销近乎减半;序列维的有损压缩只留在编码器一侧,解码器不做;另有196B参数挂的是Engram条件记忆模块。动机官方公告里说得直白——缓存命中费用常常占agent账单的大头,压缓存就是砍账单。知乎

这对A卡圈层的含义:过去两年"显存不足论"是CUDA护城河在消费端最硬的那块——大KV吃显存,显存不够连参赛资格都没有。现在模型端主动把这道门槛拆到了"主流加速卡能同时放下"的量级。16GB显存卡和395/495这类统一内存机型,恰恰是这类Flash路线最直接的受益者。
这是护城河故事的另一面,在"42倍"那组标题里一个字都不会提。
第三本账:token便宜成这样,买卡本地跑还值不值
本地党真正要算的账在这里。
API侧的实测:B站有人用近2亿token跑了8项任务,总花费约35元。 实测输出速度277 Token/s的视频拿了近3千赞;“价格打到二十分之一甚至百分之一"是实测区最常见的说法。AMD自己也在发免费额度——网友实测的"AI开发者计划"中国站和Radeon Cloud,注册送积分换GPU云算力和免费API额度,按视频录制当天的页面是注册先拿150积分再兑换云算力。 另一条8月的帖子里是"每天10美元额度约70元、0点重置”。这类额度规则更新很快,别拿旧帖当依据,一切以官网当前条款为准。B站B站
本地侧还是那几句老实话:395整机实测在15 tok/s量级;微博有人折腾一天用WSL+ROCm把一个小模型跑到24 tok/s,自己都说"真费劲"。 更直白的是16张W7900D、768GiB显存跑GLM-5.3起步只有4.08 token/s。 靠zLLM优化才拉到11.32,还是那句:显存容量解决"能不能跑",不解决"跑多快"。微博微博
再对两个站内现价:京东技嘉魔鹰RX 9070 XT页面价7849元、叠600元券后到手7249元(9月这轮显卡涨价是真的);极摩客395迷你主机14999元起。算个粗暴的比率:按35元/2亿token的实测,一张16GB A卡的价格够买几百个亿的token,用到你手动删除配置文件。

所以结论不复杂:如果只是"想用得上强模型",模型端已经把门槛降到不值得为它升级硬件。本地这笔账还立得住的只有三行——数据不出门、断网可用、以及绕开限流和峰谷计费。最后这条这周刚有人交学费:把公司批量服务从Pro切到Flash的网友自述"没搞清楚峰谷计费规则,一个月多花的钱够买一台RTX 4090"。知乎
四类人,四个动作
API党:可以换4.1 Flash,但先看清两件事——计费页的峰谷规则,以及你能不能容忍它的波动。这周的B站测评区同时存在"首发实测吊打自家Pro"的8610赞视频和"长工作流死循环、工具调用耗时、复杂任务偏离"的四问题吐槽帖。 旁边就是"紧急撤回V4 Pro下线通告"的1543赞回放,口碑摆幅比跑分大。B站
手里有A卡的:折腾可以,别把生产任务押上去。盯三个信号:下一个新模型发布时AMD镜像还差不差"两天";Lemonade 11.9那个号称AMD显卡性能+30%的实验性HRX后端、以及zLLM对Flash系列的适配实测。 再往后是下一代Flash式报告里KV量级和带宽规格——那才决定你的16GB卡还值不值。微博
等卡党:别为"跑4.1"加钱上更高配的卡。7249的9070XT是为游戏买的,AI是顺手捡的,不是倒过来的理由。
数据中心看客:42倍那本账才是你们的,对完MI450放量节点和那条2GW Helios订单的交付节奏再下结论。"一个周末崩了"叙事卖早了,这轮"42倍"恐慌也卖早了,两头都等放量价。36氪
V4.1发布这三天,"慢两天"和"890字节"其实是一枚硬币的两面:英伟达的领先仍然写在第一天,但DeepSeek用一份报告把"第一天"最值钱的那道显存门槛往下拽了。A卡用户的AI YES和先别动钱包,从来没有像这次一样,同时在理。