换个位置问同一题,DeepSeek答对率差40个百分点

换个位置问同一题,DeepSeek答对率差40个百分点

2026-10-09 15:11:38 0点赞 0收藏 0评论

把同一道题往前挪一个字符,模型答对的概率就可能掉几十个百分点。

听上去像段子,但它来自字节 Seed 团队 9 月 28 日挂上 arXiv 的一篇 65 页论文,测的对象正是 DeepSeek-V4 系列。10 月 8 日,这个话题在知乎热榜排到了第一。

换个位置问同一题,DeepSeek答对率差40个百分点

多打一个等号,答案就变了

研究者让 DeepSeek-V4-Flash-Base 补全它自己 FP8 内核里的 T.Cast(FP,然后在前面一段无关的 docstring 里,每次多加一个等号。代码一行没改,模型概率最高的预测却每两个 token 就在正确的 8 和 32 之间切换一次,周期是 4。

四种填充文本、每种 16 个长度,合计 64 个排名,其中 60 个符合这个规律。作为对照,没有用分块压缩的 DeepSeek-V3.1-Base,在同样 64 个输入里只有 4 个更偏向 32。

这跟数据本身没关系,是模型怎么存历史的问题。DeepSeek-V4 不在缓存里保留每一个过去的 token,而是把每 4 个 token 开始、长度 8 个 token 的窗口压成一个条目,于是每个 token 多出一个坐标:它是自己那个窗口里的第几个,论文管这个叫相位,算起来就是位置对步长取模。

在上下文最前面插进一个 token,内容没变、顺序也没变,变的只是哪些 token 被塞进同一个条目,所以对相位的依赖是模型结构的性质。

128K 上下文里,好位置和坏位置差 40 个百分点

为了量化,作者做了一版"大海捞针":每个提示词塞进 16000 条键值对记录,查询位置相同,各目标位置的均值和方差也相同,每个模型每组 256 个提示词。

四个 DeepSeek-V4 模型的分数都随周期 4 起伏,最好一组和最差一组差 15 到 40 个百分点。后训练把整体准确率抬了上去,差距也收窄了一些,但周期保留了。

步长变了,周期跟着变。DeepSeek-V4.1-Flash 每 2 个 token 压一次,偶数位置拿到 94.7% 到 95.3%,奇数位置只有 89.2% 到 90.3%,每组 2560 个提示词。

换个小模型从头训,同一个弱点又出现了

为了排除 DeepSeek-V4 其它设计的影响,作者用 Qwen3-0.6B 架构从头预训练了 0.6B 模型,吃 100B tokens,相对全注意力基线唯一的实质改动就是分块压缩。

步长给 4、6、8、12,周期就约等于 4、6、8、12。全注意力模型不同位置的得分差在 6.1 个点以内,压缩模型的差距最高到 78 个点。窗口 8、步长 8、8 个 KV 头那一组,压缩模型的平均准确率 59.4%,看上去和全注意力基线的 61.1% 差不多,可它的最差位置只有 9.9%,而全注意力最差的位置还有 58.4%。

平均值就是这样把问题盖住的。

作者还逐个淘汰注意力头,发现有些头只在两三个相邻相位上起作用,比如第 9 层的相位 5 和 6、第 14 层的相位 1 到 3。把门控参数循环移动一个插槽、其他权重不动,弱点就跟着移动一个,拟合度 R² 到 0.98。理论部分的解释是,让每个头专注在一个插槽上对梯度流最优,而没有力量把头推向不同插槽,于是总有些相位没人管。

两个流行说法要改一下

一种说法是"DeepSeek 不行了"。现象是真的,但不止一家:0.6B 的对照实验里只要加上分块压缩就能复现,说明问题出在这一类压缩设计上,而不是某次发布的失手。论文也没说治不好,后训练、窗口长度、步长、KV 头数都会影响弱点落在哪里。

另一种说法是"榜单第一就放心用"。这篇论文最该被记住的判断是:高平均准确率可以和系统性的位置失败同时存在。

你该怎么用它

日常聊天基本碰不到,影响主要在长文档、长代码库这类 128K 级别的检索任务上。

真要用,有个几乎零成本的习惯:同一个问题换几个位置再问一次,比如把关键文件往前挪一段,或者换个问法把目标位置错开。答案稳定,可以信;答案变了,你遇到的不是幻觉,是结构。论文给评测方的建议也是这个方向:报告长上下文准确率时,除了平均值,再按相位分开报一次。

你手上有在跑长文档的活吗?挑一个问题挪一句话再问一遍,结果欢迎丢在留言区。

作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松