凌晨还有人在我那条"Q3是不是又降智了"的帖子下面回复:你先别换量化,看看这个。
“这个”,指的是字节Seed团队那篇论文。过去48小时,本地大模型圈几乎每个角落都在转同一条消息:DeepSeek V4"神鬼二象性"的原因,被第三方逮到了。评论区最扎心的一句话是374个赞顶上去的——“这难道就是dsf神鬼二象性的原因”。哔哩哔哩
先说这篇论文能替你干什么,再说它不能替你干什么。这条线很重要,因为过去半年,本地党为了"模型突然不会了"这件事,已经付过太多冤枉钱了:有人把Q4重刷成Q6,有人从llama.cpp搬到MLX再搬回Ollama,有人怀疑kvmem把智商卸进了内存条——这些账我前面几篇都摆过。而这次论文说:有一部分"鬼",跟你的量化档位、你的runtime、你的采样参数,一·点·关·系·都·没有。
一、论文到底测了什么:"翻车"自带时钟
据界面新闻10月9日报道,字节Seed团队在9月底向arXiv提交了论文《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》。量子位的转述里有个很好复述的案例:拿DeepSeek官方推理代码里一段FP8量化函数,让模型补全最后一个Token,正确答案应该是8。然后研究人员不动代码、不动答案,只在代码前面加一段纯装饰用的文档字符串——里面是重复的等号——调整等号的数量。知乎知乎
结果答案开始以4个Token为周期反复横跳。报道记录了16种填充长度:填充长度除以4余0或1时,模型倾向答错的32;余2或3时,倾向答对的8。知乎

更狠的是128K长上下文检索测试:约1.6万个键值对,内容全部不变,只挪目标信息相对于压缩窗口边界的位置。同一条信息,站对地方和站错地方,检索准确率最大能拉开40.2个百分点——出现这个最大差距的是V4-Flash-Base。把报道里的数字按版本摆成一行:知乎
被测版本 | 不同位置最大准确率差距 |
|---|---|
DeepSeek-V4-Flash-Base | 40.2个百分点 |
DeepSeek-V4-Pro-Base | 34.8个百分点 |
V4 Flash后训练版0731 | 19.1个百分点 |
V4 Pro后训练版0813 | 14.8个百分点 |
V4.1-Flash-0910 | 6.1个百分点 |
注意每行数字的身份,别把它们混成"DeepSeek降了四成":这是百分点,不是相对降幅;是最好位置与最差位置的差距,不是平均表现;是Base权重上的实验,不等于你线上用的那个版本。知乎上10月10日EchoMind那篇专门把这层边界写清楚了——这个我后面还要回来讲。
二、三组对照实验:为什么说"这次真不是你机器的锅"
如果你只跑V4系权重的本地党,这节才是正文的核心。Seed团队为了搞清楚锅在哪,做了一族从零预训练的对照实验(知乎7197赞的高票回答"酱紫君"把它转述得很通俗):
把压缩模块里的RoPE位置编码完全拆掉——周期性弱点依然存在。不是位置编码没做好。
把可学习的门控换成最朴素的均匀平均池化——依然存在。不是某个训练技巧翻车。
把压缩步长分别设成4、6、8、12——准确率波动的周期分毫不差地变成4、6、8、12。知乎

结论就一句话:只要你用固定步长静态切块压KV Cache,“相位"这个位置坐标就必然存在,某些槽位天然是盲点。酱紫君那套说法是:V4的压缩机制每挪4个Token,就把8个Token的局部窗口压成1条KV向量,训练会诱导出强势槽位和盲点槽位——你的关键信息落在门控高峰槽位,近乎无损保留,检索表现甚至比MLA还好;落在死角槽位,信息在物理层面就没进缓存,模型再聪明也只能"巧妇难为无米之炊”,然后开始胡言乱语。知乎
对本地党,这意味着一件省钱的事:"相位型"的抽风,重刷量化、换推理引擎、调采样参数都救不了,因为它们都不改变权重里这套切块压缩的结构。你Q8_0没坏,你那张4090也没坏。
三、但先别急着高兴:你的"降智"不一定都是相位
反证必须摆在这。我把过去两个月社区里的"降智现场"翻了个遍,发现至少有四种账不能一股脑记到相位头上:
量化自己的账:低档位(Q2、2bit级)跑崩、死循环,那是信息真被压没了,和位置无关。B站8月那条"大模型死循环怎么办,三招驯服本地大模型"(7098播放)教的招数大多还是采样和上下文参数——那些账依然成立。
KV搬运自己的账:kvmem这类显存外挪方案"损失智商",是缓存精度/完整性的问题,另一本账。
"性格"的账:10月1日B站那条《v4.1flash用着累?这不是你的幻觉!》攒了40197播放和416条评论,高票吐槽集中在"指令遵循极差但莫名其妙遵守旧命令"“过度测试”“听不懂人话”——这是对齐和行为风格问题,日报评论区有人104个赞自曝:八月拿dsv4跑自建事实核查skill,“一读大片文章把skill上下文落入中段后就直接不按skill走,改语法改到几乎抓狂,结果v41出来它一下就能遵守了”——这条一半是性格账、一半恰好踩在相位账上,两种病在同一个病人身上。哔哩哔哩
风控和harness的账:模式合并、审核增强带来的"变笨"体感,xhs九月那批"咋突然就萎了"(441赞162评)、“失望啊真的拉了”(123赞57评)的帖子吵的多数是这个。小红书
那怎么快速分辨?论文给了一个几乎免费的判别实验:内容不动,只挪位置,反复问。同一道题,在原题面前加一句不同的填充话(比如一行无关的注释、一段礼貌用语),多试几个长度。如果答案质量随前缀长度明显变档——“换个问法结果差一个档次”(9月30日xhs那条帖子的原话)——相位嫌疑很大;如果怎么挪都稳定地错,那是别的账,回去翻你那三本。小红书
操作时有两个坑,EchoMind那篇提醒得很对:Token不等于字符,照着报道"多敲两个等号"不算复现,一段汉字切几个Token要看实际分词;而且挪位置时别破坏"标题与正文、函数与注释"的语义配对,否则测到的是结构变化不是相位。还有一条要记死:目前这套数字来自媒体转述,知乎和B站的解读互相之间不少还是同源转载,尚无公开的本地机独立复现——今天刚出现的解读视频("无卡野人"那条,5322播放)也还停在解释论文,没有摆出自家真机的曲线。知乎哔哩哔哩

四、本地党的三本账:版本、用法、评测
版本账:表里那行6.1个百分点是这篇论文最有行动价值的数字——V4.1-Flash把Base时代的最大相位差从40.2压到了6.1,后训练加架构调整确实有效(酱紫君的说法是步长腰斩成两两合并、V4.1改用浅层压缩+深层全局KV投影的CED方案,但"任何固定步长静态切块都无法根除,只能压小")。问题是升级门票:10月5日知乎回答里算过,V4.1 Flash权重510GB,本地门槛"从两张卡升到八卡起步"。丐帮党要么接受0731那19.1个百分点的旧相位差继续用,要么把权重钱和电费钱一起摆——这不是退订API的理由,也不是不退订的理由,是每台机器自己的账。知乎

用法账:把"相位"当成布线规范。系统提示、skill规则、关键证据尽量放上下文的头部和尾部,别让它们孤零零躺在长材料中段;Agent跑歪的时候,先原封不动换个问法重跑一遍,再决定改不改prompt——那条"改skill语法改到抓狂"的104赞,改的根本不是语法,是站位。
评测账:论文顺带把开源Benchmark的老底掀了:常规评测把大量测试汇总成一个平均分,模型完全可能某些相位很强、某些相位明显掉队,平均分依然好看。所以你自己选型的时候,拿你最常用的那几类任务做"内容不变、位置变化"的配对测试,按最差位置的表现决定去留——这比再看十个"吊打XX"的榜单值钱。
五、为什么这48小时圈里集体松了口气
数字本身是冷的,但社区反应是热的。B站10月8日AI日报那条视频54330播放、863赞、259评论。 知乎提问下酱紫君的回答攒到7197赞。"神鬼二象性"这个梗已经出圈到微博,有人专门转发帖解释这个词(74赞)。 贴吧热议被剪成视频(16072播放)。更早的9月11日那条吐槽视频,47198播放、1081条评论。哔哩哔哩微博哔哩哔哩
这份热度的底色不是吃瓜,是平反感。“降智"帖从8月刷到10月,发帖的人被回复过无数次"是你机器不行”“是你prompt没写好”。现在第三方论文说:确实有一部分不是你的问题,是模型站的位不对——“对齐了就是超神,进盲点就是超鬼”。对还在纠结要不要弃坑本地的轻度玩家,这句话的情绪价值比6.1个百分点还大。
六、接着盯什么
DeepSeek官方是否回应、下一版权重是否继续收窄相位差——6.1到0还有多远,是丐帮等不等下一张门票的唯一坐标。
"跨相位分别评测"会不会进入公开评测集和llama.cpp/MLX这类本地runtime的诊断工具——理想解法(内容感知的动态切块)目前还停在解读里。
本地党的真机复现曲线——现在全网只有媒体数字和转述,还没有一台4090上量出来的"同题换位"实测。谁先摆出来,谁的账才算落地。
带走一句就够了:你的卡没缺,你的量化没坏,你的采样参数这次可以不动——先把你那句关键话从材料中段捞出来,挪到头或尾,再问一遍。换站位,是本地党今年最便宜的一次调参。