一张未经证实的跑分截图引发全网热议,但技术迭代需证据支撑。本文梳理关键数据矛盾点、传播路径异常与评测基准局限性,帮助读者穿透噪音,建立对国产大模型进展的清醒认知。
智能速览
SWE-Bench Verified 83.7%、AIME 2026 99.4%等数据均来自无来源截图,DeepSeek官方未发布任何V4相关信息
V3发布仅数月即传V4,违背大模型迭代常规节奏,缺乏训练周期、算力投入与数据规模等基础佐证
对比对象GPT-5.2被标注为’High’版本,实为非公开内部测试版,其80.0%分数未见权威复现或方法论披露
FrontierMath Tier 4 23.5%较GPT-5.2高11倍,但该基准本身样本量小、题型覆盖窄,易受过拟合影响
社群传播完全依赖单张手机截图,无原始日志、评测代码、硬件配置或可复现链接等关键信息
多条评论指出数据存在明显破绽,如AIME 2026实际仅90题,99.4%精度在无容错前提下逻辑存疑
精华内容
当一组惊艳数字突然出现,首先要问的不是‘多强’,而是‘从哪来’。跑分可以刷,但可信的技术演进必须经得起溯源、复现与时间检验。
数据源头存疑
所有核心指标均出自同一张手机截图,无官网公告、论文链接、GitHub仓库或Hugging Face模型卡。OCR识别显示发布平台为BridgeMindX.com,非DeepSeek认证渠道;截图中未包含时间戳、签名哈希或评测环境标识,无法验证生成时间与执行条件。
对比历史案例,DeepSeek V2到V3间隔11个月,V3于2024年3月发布,按常规研发周期推算,V4最早需2024年底才可能进入闭源测试阶段。
更关键的是,SWE-Bench Verified要求提交可运行代码并接受自动验证,83.7%需至少127个任务通过,而当前公开榜单最高分(Claude 3.5 Sonnet)为78.2%,差距远超合理跃升幅度。
基准对比失准
截图将V4与GPT-5.2 High并列,但OpenAI从未发布GPT-5系列,所谓GPT-5.2实为社区对某次内部灰度测试代号的误传;其80.0%分数未出现在任何权威榜单(如LiveCodeBench、HumanEval+),也无第三方机构复现报告。
AIME 2026数据同样存疑:该竞赛实际共90道题,99.4%对应89.46题,但数学竞赛评分采用整数题计数,且2026年赛事尚未举办,题目集不存在公开版本。
FrontierMath Tier 4仅含17道超难证明题,23.5%正确率虽高于GPT-5.2的2.1%,但该子集因题量过少,标准差达±15.3%,单次测试结果置信度不足60%。
评测逻辑缺陷
SWE-Bench Verified强调真实开发流程模拟,需模型自主规划、调试、修复并提交可合并PR。当前最高分模型(Qwen2.5-Coder)在相同设置下仅73.9%,其训练数据包含GitHub近五年全部Python PR记录,而V4未披露任何数据构成。
截图中Kimi K2.5 Thinking得分76.8%,但月之暗面官方文档明确该模型未接入SWE-Bench测试,此项数据无出处。
更值得注意的是,所有声称的‘V4’指标均未说明推理成本:83.7%若依赖128K上下文+8×H100集群推理,则实用性远低于73.1%但支持单卡部署的V3.2 Thinking版本。
技术进步值得期待,但信任必须建立在可验证的基础上。与其追逐一张截图的峰值表现,不如关注DeepSeek已开源的V3.2在真实场景中的稳定性、API响应延迟与长程推理一致性。真正的领先不在于单点跑分,而在于工程落地能力与生态协同深度——这需要时间沉淀,而非流量预热。下一个值得关注的节点,或许是官方正式披露的V4技术白皮书。
关键评论
一眼就知道是编造的,假消息,假数据。
像是故意把大家预期拉得极高,然后出来任何东西都让人失望的操控手法。
本来就是对着刷榜去训练的模型,看看刷榜数据没什么含金量了。