这几天AI圈最热闹的一件事,是字节跳动和DeepSeek隔空打起了擂台。字节Seed团队9月底在arXiv提交了一篇论文,本周经媒体集中报道后彻底引爆,微博话题#字节团队发现DeepSeek抽风原因#被顶了上来。这篇论文的标题就很直白——《Periodic Weak Spots》(周期性弱点)。知乎上「如何评价字节Seed团队发现DeepSeek性能漂移」这个问题下面,一条把机制掰开揉碎讲清楚的回答,截至发稿已经拿下6900多赞、200多条评论。高赞总结只有一句话:DeepSeek V4神鬼二象性的原因找到了——对齐了就是超神,进盲点就是超鬼。而评论区744赞的最高赞评论是:「我居然看懂了一点,你的表达能力太好了。」这说明什么?说明被DeepSeek「抽风」折磨过的用户,真的很多。微博知乎知乎
一、你骂过的「降智」,可能真是被冤枉的玄学
先别急着看技术,先看用户端这几个月的真实抱怨:
10月2日凌晨,有人发帖「如何看待DeepSeek2026年10月02日03:40起崩溃(性能下降)?」,一条回答拿了239赞。知乎
「deepseekv4.1flash拉完了,实际使用比dsv4f差不少,为什么大家对此毫无反应?」这条抱怨下面,210赞、36条评论。知乎
小红书9月一条404赞、72评论的帖子写着:「更新后简直是一塌糊涂 无论是日常聊天还是角色扮演,AI显得更冷漠,共情能力变差。在角色扮演中,AI的逻辑能力也时好时坏」。小红书
微博一位用户更早就自己摸到了线索:「遇到好几回,Deepseek会这样抽风输出。大部分时候都要这样自言自语十几秒才继续干活。触发机制我感觉是上下文压缩次数多了以后。」
注意最后这条——普通用户靠体感猜的方向,和字节论文用实验锤实的机制,是同一个东西:上下文压缩。过去大家怎么解释「同一个问题,昨天答得像博士、今天答得像实习生」?采样随机性、服务器负载、官方偷偷降智、甚至「AI也有心情」。多数用户把这类不稳定归因于服务器压力过大、访问人数过多,而最新的技术研究显示,模型架构本身的设计选择才是核心原因。这些旧解释有个共同点:没法验证,也没法应对,你只能重问一遍碰运气。字节这篇论文给出的解释不一样:这是写死在架构里的结构性现象,有周期、有规律、可复现。微博界面新闻
二、实验有多狠:在前面加几个「=」号,答案就来回翻烧饼
论文做了两组关键实验,数字先摆出来。
第一组:代码补全实验。研究人员拿DeepSeek自家的FP8量化函数代码,让DeepSeek-V4-Flash-Base补全最后一个Token——补全位置停在「T.Cast(FP」后面,正确答案是8(组成FP8)。然后他们在代码前面的注释里加了一段纯装饰性的文档字符串,里面只有一串等号,没有任何语义。代码没改、问题没改、正确答案没改,唯一的变化是等号的数量。结果模型的答案在8和32(FP32)之间反复横跳,周期正好是4个Token:等号数量除以4余0或1时,模型71.3%的概率答错成32,正确答案8只有26.4%;余2或3时情况直接反过来,8的概率升到91.5%,32只剩7.2%。换了四类填充文本、每类16种长度,64个样本里60个符合这个规律;而没有分块压缩的DeepSeek-V3.1-Base做对照,只在4个样本上偏向错误答案,概率差距不到0.07。翻译一下:你在问题前面多打了两个字,DeepSeek就可能从答对变成答错——再打两个字,又对了。这不是段子,是论文里的实验数据。量子位知乎

第二组:128K大海捞针。研究人员构造了长达12.8万Token的上下文,每个prompt里放约1.6万条键值对,让模型找出指定Key对应的Value。键值关系、问题、上下文总长度全部不变,只挪动目标信息的位置——同一条信息只是换了个位置,DeepSeek-V4系列模型的检索准确率最高就能拉开40.2个百分点。各版本的差距如下:知乎量子位
模型版本 | 不同位置间的最大准确率差距 |
|---|---|
DeepSeek-V4-Flash-Base | 40.2个百分点 |
DeepSeek-V4-Pro-Base | 34.8个百分点 |
V4-Flash后训练版(0731) | 19.1个百分点 |
V4-Pro后训练版(0813) | 14.8个百分点 |
V4.1-Flash(0910,最新) | 6.1个百分点 |
同一份资料、同一个问题,信息「站的位置」不同,检索准确率最大能差40个百分点。这就是「时灵时不灵」的全部秘密。

三、机制一句话版:压缩记忆有「座位表」,有的座位是VIP,有的座位是死角
为什么会这样?核心在DeepSeek V4用的一项省显存技术:分块KV Cache压缩。大模型处理长文本时,要给每个历史Token存一份「记忆缓存」(KV Cache),上下文越长,显存和计算开销越大。DeepSeek V4为了用极低成本跑超长上下文,把连续的Token分成一个个窗口,再将窗口内的信息压缩成更少的缓存条目。压缩之后,每个Token除了「在全文第几个字」这个绝对位置,还多了一个隐藏坐标:它在压缩窗口里排第几——论文把这个相对于压缩窗口边界的位置称为Phase(相位)。量子位
具体到DeepSeek V4:它的CSA(压缩稀疏注意力)会把连续若干个Token的KV压成一条缓存,V4是窗口8、步长4——每向前移动4个Token,就把一个包含8个Token的局部窗口通过可学习的门控压缩层合并压成1条紧凑的KV-Cache向量,训练过程中会诱导出强势槽位和盲点槽位。关键就在这里:目标信息若落在门控的强势槽位,特征近乎无损保留,甚至顺带降噪,检索准确率极高;若落在死角槽位,信息在物理层面就没被存进 KV Cache——米都没下锅,上层模型推理能力再强,也只能根据局部统计概率现编一个,表现出来就是胡言乱语、答非所问,也就是你眼里的「抽风」。知乎

更狠的是,Seed团队为了证明这不是DeepSeek调参没调好,拿Qwen3-0.6B架构从零训了一批对照模型:
把压缩步长分别设成4、6、8、12,准确率波动的周期分毫不差地跟着步长走——研究人员分别调整窗口大小和压缩步长,发现周期主要跟着压缩步长变化。量子位
去掉RoPE位置编码、把可学习门控换成最笨的均匀平均,周期性弱点依然存在——不压缩的模型各个位置之间最多差6.1个百分点,压缩的最多差78个,哪怕把压缩换成最笨的组内取平均,这个周期还在。知乎
没有分块压缩的全注意力对照组,没有出现同等程度的周期性波动。
结论:只要你离散的定长切块,那么就必然打破序列平移对称性,存在一定的神鬼二象性问题——这不是DeepSeek一家的bug,是整条固定步长压缩路线的结构性代价。这也解释了为什么各大榜单看不出来:现有长上下文评测的目标位置基本是随机放的,各个相位被均匀抽到,最后取个平均,强相位和弱相位正好互相抵消,得到一个看起来很健康的分数。界面新闻把这层窗户纸捅得更透:平均得分实际上是模型在不同相位下表现高低互抵后的结果,大量用户实际遇到的,恰恰是检索准确度处于低位的相位区间。指标没有骗人,只是它回答的问题和你真正关心的不是同一个。论文里还有组更扎心的数字:某个压缩配置的模型,平均准确率和不压缩的全注意力基线几乎一样,可它最差那个相位的准确率只有9.9%,全注意力基线的最差相位是58.4%——平均分持平,最坏情况差了近50个百分点。知乎知乎界面新闻

四、先泼三盆冷水:别把这件事读过头
热度越高越要去噪。这三个澄清,能帮你避免误判:
第一,「性能漂移」这个词本身就是转述走样。说是“性能漂移”,不太准确——漂移听着像随着上下文变长性能慢慢变差,论文测到的其实不是这个,是周期性的起伏:同一条信息放在第n个Token处模型找得到,挪一两个Token就找不到了,再挪一两个又找得到。搞清楚这点很重要:如果是缓慢退化,你只能少喂长文;但既然是周期性起伏,换个问法就能自救。知乎
第二,这不是「字节锤DeepSeek」的宫斗剧情,至少目前证据不支持阴谋论。论文是预印本、未经同行评审,字节和DeepSeek也确实存在竞争关系,这些要在心里打个折。但实验基于DeepSeek开源的权重和推理代码,方法可复现,知乎技术圈的讨论主流是认可机制成立的。有条43赞的评论说得克制:这次字节不是故意跳出来挑毛病,而是因为它是一个没走国模扎堆同一条路线的团队,用可复现的实验数据,指出了一条被国模广泛采用的技术路线所存在的结构性问题。反过来想更妙的一点:闭源模型如果用了同类压缩方案,外界根本没机会发现——DeepSeek被挑出毛病,恰恰是因为它把权重、kernel和技术细节全开源了。效率和精度的取舍本来就躲不掉,问题在于我们得先看见取舍了什么。知乎
第三,DeepSeek自己在收敛,且小红书那波抱怨不能全算在这头上。从40.2到6.1个百分点,V4.1-Flash靠步长腰斩(4改2)、CED新架构(只在浅层做压缩粗筛、深层改用全局KV投影)加后训练,已经把差距压掉了85%——V4-Flash后训练版差距缩小到19.1个百分点,V4-Pro后训练版缩小到14.8个百分点,而更新的V4.1-Flash差距进一步降至6.1个百分点。在最新的V4.1-Flash上,偶数位置准确率稳定在95%左右,奇数位置在89%-90%——差距小了很多,但周期性依然存在,任何固定步长方案都无法根除。有位答主把这笔账总结成了一个「不可能三角」:长、准、省,最多占两样,三样都要,就得加钱。另外注意:9月小红书、B站那波「更新后语气变差、角色扮演变冷」的大规模差评,主因是后训练的对齐策略调整,和相位敏感是两码事;但「逻辑能力时好时坏」这类抱怨,和相位机制高度吻合。别把所有不满装进同一个筐。截至发稿,DeepSeek官方对这篇论文没有公开回应。量子位知乎

五、对号入座:4类人各自的行动单
机制看懂了,落到行动上就一句话:「上下文长度」从此是一个你能控制、也应该控制的变量。
① 网页/App闲聊党(短对话为主):不用跑,学会「科学重试」。 短上下文受影响最小,该干嘛干嘛。但以后遇到答错、答偏、突然降智,别再原样重问碰运气了——在问题开头加或删几个字再问一遍(比如加个「请」字、换个称呼开头)。有位答主给出了自测方法:把同一个问题原样问一次,再在最前面分别加1、2、3个无意义的字符各问一次,看答案会不会跟着变。以前这叫玄学仪式,现在这叫改变相位,有论文背书。两次都错,再考虑它是真不会。知乎
② 长文档党(论文、合同、报告喂给AI的):关键信息有「座位」,别让它坐死角。 128K大海捞针测的就是你的日常。三个动作:超长文档分段喂,每段单独提问,比一次性塞满更稳;最关键的那条信息(金额、日期、条款号)换个位置多问两遍,两遍答案对不上就说明踩到弱相位了;重要抽取任务别只信一次输出。界面新闻也提到,早有用户摸索出了实用经验:把提示语里的关键内容放在最前面,能大幅提升模型准确抓取信息的概率。界面新闻
③ 程序员/API开发者:「玄学bug」终于有排查方向了。 这是论文对工程侧最实际的启发:离线环境复现不了线上的错误,可能不是温度参数的问题,是线上请求的前缀多了3个token——用户名长度、时间戳格式、system prompt里的一个空格都算。上线前在评测集上做一次padding扫描——同一批用例加不同长度的无害前缀各跑一遍,按相位分组看准确率。对一致性要求高的场景(代码补全、合同条款抽取),可以对同一请求做几种不同长度的前缀填充、取多数结果。知乎
④ 换模型观望党:先看你的场景,再看价格。 好消息是,DeepSeek-V4.1-Flash的性能漂移要轻微很多。你的主场景如果是长上下文检索/Agent任务:V4.1-Flash差距已缩到6.1个百分点,价格依然是同档杀手锏,没必要连夜搬家;预算充足、任务对一致性极度敏感,可换全注意力架构的模型——没有这个结构性问题,但长文本成本更高。你的主场景如果是短对话、写作、日常问答:这件事对你的实际影响很小,选模型该看文笔看文笔、该看价格看价格,别被标题党带节奏。顺带一个观察点:评论区已有人点名Kimi那种隔一层线性注意力、隔一层全注意力的交错设计,理论上是另一条规避路线——真假还得等同类实测,先记在观察清单里。知乎知乎
六、接下来盯什么
三个信号,值得放进你的关注列表:
DeepSeek官方是否回应——是出相位曲线自证,还是在下一代里直接上「按内容动态分块」:比较理想的方法就是引入 Content-aware Chunking,根据注意力权重动态决定压缩边界,此时网格中不再存在固定的相位概念。知乎
评测榜单是否跟进「按相位分组」——「按相位报告准确率」大概率会成为高效注意力论文的标配,如果半年内主流长上下文榜单还是只看平均分,那你看到的分数依然会自动抹平最差情况。知乎
其他采用分块压缩路线的模型是否被复测——论文作者自己也承认,这个代价很可能存在于所有按固定步长分块压缩KV的方案里,谁用谁可能有,不是DeepSeek一家的家族病。
最后说句公道话:这篇论文没有证明DeepSeek不能用,它证明的是DeepSeek的「不能用时刻」有规律可循。对普通用户来说,从「骂降智」到「懂相位」,最大的变化是——下次它抽风的时候,你手里有牌了。