针对DeepSeek疑似更新的传闻,通过24万字长篇小说进行实测,发现其在角色指认和事实准确性上较早期灰度版本有显著提升,验证了模型确有实质性优化。
智能速览
质疑网络流传的版本细分缺乏官方依据
早期模型处理20万字文本时出现严重幻觉
新模型处理24万字文本准确率极高
四轮复测中仅出现一次角色指认错误
结论:DeepSeek近期至少进行了一次实质性更新
精华内容
针对网上流传的版本细分图,通过高强度的长文本实测来验证性能变化,结果证实模型能力确有显著飞跃。
传闻质疑
网络流传着一张关于DeepSeek V4-lite细分版本的图片,声称包含初始版及多个带日期版本。这种缺乏官方音讯和大规模传闻支撑的精细划分显得颇为可疑,因此需要通过实际评测来辨别真伪。
测试场景
此次评测选取了总字数达24万字的长篇小说稿子,重点考察模型对复杂人物关系和剧情逻辑的梳理能力。在早期灰度测试阶段,面对20万字左右的文本,模型曾出现严重的幻觉和低级错误,无法准确对应角色与行为。
性能突变
今早的实测结果显示,面对增加至24万字的文本,模型表现判若云泥。经过四轮严格测试,DeepSeek仅在首轮中出现一次角色指认错误,后续三次刷新均完美通过,逻辑严密性大幅提升。
实锤优化
基于确凿的测试数据,虽然可以否定网络上传闻的多次微小版本更新,但可以确信DeepSeek近期必定进行了不少于一次的实质性底层优化。这种长文本理解能力的质变,证明了官方在后台进行了有效的模型迭代。
此次实测不仅验证了DeepSeek在长文本处理能力上的巨大进步,也证实了模型更新的真实性。随着长文本逻辑的进一步强化,未来在专业创作和复杂分析领域的应用潜力令人期待。