张大妈

DeepSeek更新模型,V4要来了?只有梁文锋知道!

源自公众号:人工智能X智能体

02-12 08:25

DeepSeek悄然开启百万token上下文窗口的灰度测试,直指此前短板。此举不仅追平行业顶尖水平,结合近期发布的技术论文,更被解读为下一代模型V4即将到来的重要信号。

DeepSeek更新模型,V4要来了?只有梁文锋知道!智能速览

  • DeepSeek灰度测试百万token上下文,知识库更新至2025年5月。

  • 上下文长度从此前的128K翻涨8倍,弥补了关键短板。

  • Engram模块与DSA机制结合,有效降低长序列推理成本。

  • 当前版本仍为纯文本模型,暂不支持多模态视觉输入。

  • 业内普遍猜测此次更新为V4的前奏,但官方尚未确认。

DeepSeek更新模型,V4要来了?只有梁文锋知道!精华内容

从128K到1M,上下文窗口的跃升不仅是数字游戏,背后是架构的重塑与技术的积淀。

百万上下文解锁

2月11日,DeepSeek开启灰度测试,将模型的上下文窗口从128K token大幅提升至1M token级别。这意味着模型能够一次性处理《三体》三部曲或整本《简爱》等超长文本,并准确识别其中细节。

同时,其知识截止日期也更新到2025年5月,即便不联网也能回答近期的新闻事件,大幅提升了信息的时效性与处理能力。

技术底座支撑

此次升级并非凭空而来。过去一个月,DeepSeek连续发布两篇关键技术论文。其中,Engram模块提出的“条件记忆”与“查算分离”架构,通过哈希查找替代昂贵的神经网络计算,能将高达100B参数的嵌入表卸载到CPU内存,推理延迟增长低于3%。

这种架构天然适配超长上下文,结合V3.2中引入的DSA稀疏注意力机制,理论上显著降低了长序列推理的计算成本,为百万token的实现提供了可能。

V4前奏猜想

以往128K的上下文是DeepSeek V3系列的明显短板,此次直接对标Google Gemini的1M级别,使其在关键指标上跻身第一梯队。

尽管当前版本仍为纯文本模型,不支持视觉输入,但结合mHC论文解决的大模型训练稳定性和Engram的推理优化,业内普遍猜测这便是传说中V4模型的前奏。真正的迭代或许仍在酝酿,一切谜底有待揭晓。

百万上下文的灰度测试,为DeepSeek补齐了关键短板,也展示其深厚的技术储备。这盘“开胃饺子”之后,真正的“年夜饭”值得期待,它将如何重塑大模型竞争格局?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章