一张 DeepSeek-V4 的泄露跑分图在网络上迅速传播,其数据看似碾压所有对手。但这张图背后疑点重重,通过对关键数据点的剖析,可以发现这更像是一场精心编造的数字游戏,而非真实的性能展现。
智能速览
泄露的 AIME 2026 成绩 99.4% 存在数学矛盾,不可能实现。
FrontierMath 23.5% 的数据对比引用了错误的基准模型。
伪造的跑分图被二次加工成更精美的“分析图表”流传。
尽管跑分图存疑,但多项论文和代码更新暗示 V4 确实存在。
精华内容
这张广为流传的 DeepSeek-V4 跑分图,其数据的真实性究竟如何?通过逐项分析,可以发现其中隐藏的漏洞。
不可能的分数
图表中显示 DeepSeek-V4 的 AIME 2026 成绩为 99.4%。AIME 是美国数学邀请赛,其扩展版评估共 120 道题,满分 120 分。因此,可能的分数只有两种:答对 119 题得分率为 99.2%,或答对 120 题得分率为 100%。99.4% 的得分率意味着答对了 119.28 道题,出现小数点后的题目数量,这在数学上是不可能的,直接暴露了数据造假。
错误的数据对比
图表声称 DeepSeek-V4 在 FrontierMath 上达到 23.5%,并比 GPT-5.2 好 11 倍。然而,根据图表内 GPT-5.2-High 的 18.8% 成绩计算,23.5% / 18.8% 约等于 1.25 倍,远非 11 倍。这个巨大的差异很可能是因为制作者错误地将 DeepSeek-V3.2 的 2.1% 成绩当作了对比基准,从而制造了虚假的巨大优势。
二次传播的谎言
更值得警惕的是,另一名网友基于这些未经证实的数据,制作了一张更精美的“分析图表”。该图表不仅使用了虚假数据,还加上了“突破性推理”、“效率与速度”等看似专业的分析标签,使其看起来更具可信度,加剧了不实信息的传播,让更多读者信以为真。
真实的发布信号
尽管跑分图是假的,但 DeepSeek-V4 即将发布的消息并非空穴来风。多项证据指向了这一点:1 月 1 日,创始人梁文锋署名发表新论文;1 月 20 日,代码库出现 28 处指向新架构“MODEL1”的引用;2 月 11 日,官方悄无声息地将上下文长度扩展至百万级别。这些真实的动作表明,V4 确实存在,只是其真实性能尚待官方揭晓。