DeepSeek悄然更新,将上下文窗口提升至百万Token级别,实现了对《三体》全集的单次处理。这不仅是长文本处理能力的飞跃,更关乎其在复杂信息分析和知识推理领域的潜力。通过实测与技术解读,可以清晰看到其背后的创新逻辑。
智能速览
DeepSeek模型上下文窗口升级至百万Token。
实测可一次性处理《三体》全集等超长文本。
新版本暂不支持视觉输入与多模态识别。
年初公布mHC与Engram两项创新底层架构。
市场期待其新一代旗舰模型V4的发布。
精华内容
这次更新远不止数字的堆砌,从实测表现到技术储备,DeepSeek正悄然构建起自己的竞争壁垒。
百万上下文实测
根据实测,DeepSeek新版能够识别并处理超过24万个Token的《简爱》文档。当挑战90万字的《三体》三部曲全集时,模型虽然处理速度稍慢,但仍在几分钟内成功完成阅读和理解任务。这证明了其百万上下文窗口并非虚标,而是具备实际应用价值。
此外,模型的知识库截止时间也更新至2025年5月,保证了信息的时效性。
当前能力边界
尽管长文本处理能力大幅提升,但新版本模型仍有明确的局限性。目前,该版本不支持视觉输入,也不具备多模态识别能力。这意味着它无法处理包含图片或视频的复杂信息输入,其应用场景暂时仍聚焦于纯文本领域。
对标国际前沿
在AI领域,将上下文窗口推至百万级别是少数顶尖模型才能实现的技术。DeepSeek此次更新,使其与谷歌的Gemini系列和Anthropic的Claude Opus 4.6等国际先进模型处于同一梯队。
DeepSeek的V系列模型定位为追求极致综合性能的基础模型,此次更新进一步巩固了其在基础模型领域的竞争地位。
底层技术突破
此次能力飞跃并非偶然,其背后是DeepSeek在底层架构上的持续创新。今年初,团队发表了两篇重要论文,公开了mHC和Engram两项创新架构。
mHC用于优化深层Transformer信息流动,提升训练稳定性;Engram则通过解耦静态知识与动态计算,显著降低了长上下文推理成本。这两项技术被视为中国在算力受限环境下通过算法创新实现突破的关键。
未来版本展望
市场的目光正聚焦于传闻中的DeepSeek V4。根据科技媒体爆料,新一代旗舰模型将在农历新年期间推出,预计会具备更强的代码生成能力。
同时,DeepSeek官方GitHub代码库中一个名为“MODEL1”的未知模型架构标识被多次提及,暗示了其在研发路径上可能还有更多惊喜。
DeepSeek的百万上下文更新,是一次长文本处理能力的实质性跨越。结合其底层技术创新和对未来的布局,其在AI领域的潜力值得关注。它将如何利用这一优势改变应用场景?