DeepSeek完成了一次小版本但关键的升级,虽未等来V4,但其在上下文容量、长效记忆模块及代码处理能力上的优化,显著提升了实际使用体验,为关注AI发展的用户提供了更强大的工具。
智能速览
上下文处理容量从128k大幅提升至100万token。
新增Engram记忆模块,为AI赋予长效记忆能力。
OCR能力升级,能先理解版面逻辑再识别文字。
代码能力增强,可理解高达10万行代码的完整项目。
内部消息确认,V4大版本不会在春节期间发布。
精华内容
虽然并非期待已久的V4大版本,但DeepSeek此次的悄然更新,却在核心能力上带来了实质性的提升,特别是长效记忆的实现,为AI交互开启了新的可能。
上下文容量跃升
此次升级最直观的变化是上下文容量的显著扩张,从此前的128k直接提升至100万token,实现了8倍的增长。
这一数据意味着模型现在能够处理相当于约150万个单词或约200万汉字的输入量,足以轻松容纳多本书籍或一份完整的财报。
更重要的是,这次提升不仅在于数字,更在于其稳定性,确保了用户在实际使用中能够真正利用到这庞大的上下文窗口。
外接式记忆系统
升级的核心亮点之一是引入了Engram记忆模块,这一概念源于一个月前梁文峰署名的论文。
它相当于为AI模型安装了一个“外接硬盘”,将推理过程和记忆存储分拆成两个独立的系统。当需要记录信息时,不再占用核心推理算力,从而避免了长时间对话后模型性能下降或“越聊越笨”的问题。
这一设计让模型拥有了属于自己的长效记忆系统,为持续、深入的对话交互奠定了基础。
视觉与代码增强
在视觉理解方面,新版本的OCR能力不再是简单地调用工具进行文字识别,而是能够先理解整个页面的版面布局和逻辑关系,再进行精准识别,大大提升了处理复杂文档的准确性。
代码能力同样迎来重要升级,新版模型可以理解并分析包含高达10万行代码的整个项目,并能追踪跨文件的函数调用链。
对于开发者而言,这一功能可以辅助理解复杂代码库,快速定位问题,实用性非常强。
未来版本展望
针对外界最关心的V4版本,内部人士透露,春节期间不会有重大更新,团队会按照自己的节奏稳步推进。
有观点认为,此次灰度更新的内容本质上是V4能力的分批释放和提前验证,最终的正式版本预计会带来更惊艳的表现。
随着DeepSeek的这次升级,国产大模型领域的竞争愈发激烈,接下来GLM-5、MiniMax的M2.2以及千问的Q1-3.5等模型也将陆续登场,一场技术竞赛才刚刚开始。
此次DeepSeek的更新虽是小步快跑,却精准地解决了长上下文和长效记忆两大痛点,为后续V4版本的发布铺平了道路。国产模型竞争已进入白热化阶段,接下来的技术突破值得持续关注,谁能率先拿出颠覆性应用?
关键评论
有用户关注其编程能力何时能追上Claude。
有网友指出此次更新并非外界期待的V4大版本。
部分用户认为DeepSeek团队是低调专注做产品的类型。
有评论调侃厂商们正忙于市场推广,无暇顾及大版本发布。