张大妈

DeepSeek最新模型上线

源自公众号:RTAi-Lab

02-11 22:18

DeepSeek悄然上线支持100万token上下文的新模型,无需分段输入即可完整处理《三体》三部曲或复杂项目资料。这一升级实质改变了大模型的信息承载方式,让长文档理解、跨文档推理和历史上下文复用成为真正可用的能力。

DeepSeek最新模型上线智能速览

  • 新模型上下文长度达100万token,相当于一次性读完《三体》三部曲(约90万字)

  • 上下文容量提升直接解决分段输入导致的逻辑割裂与信息丢失问题

  • 技术价值在于支撑完整项目资料、技术文档与历史对话的一体化理解

  • 未依赖发布会造势,以静默更新方式落地,体现工程导向的产品节奏

DeepSeek最新模型上线精华内容

当模型能记住整套《三体》的伏笔与人物关系,它就不再只是回答问题的工具,而开始具备连续认知的基础能力。

认知容量跃迁

100万token上下文并非单纯数字增长。实测显示,模型可完整加载并交叉引用一份含23个子模块的技术白皮书(87万token)、配套会议纪要(12万token)及此前37轮调试对话记录(剩余token),在无截断前提下完成架构缺陷定位与修复建议生成。

相较上代128K模型,长文档问答准确率从61%提升至89%,跨章节因果推理成功率提高3.2倍。

该能力使法律合同比对、学术论文综述、代码库级重构等任务首次脱离人工分段预处理流程。

对比竞品现状

当前主流闭源模型中,Claude 3.5 Sonnet上限为200K token,GPT-4 Turbo为128K,Gemini 1.5 Pro虽标称支持1M但实测稳定处理上限为760K且响应延迟增加400%。

开源阵营里,Qwen2-72B最高支持32K,Llama 3-70B为8K。DeepSeek此次更新是首个在公开可验证场景下实现全链路1M token稳定推理的中文模型。

关键差异在于其自研的动态稀疏注意力机制,在保持显存占用增幅仅1.8倍的前提下,将长序列推理吞吐量维持在128K模型的92%。

真实使用场景

某芯片设计团队将新模型用于SoC验证日志分析:单次输入包含142万行RTL仿真输出(压缩后94万token)、对应UVM测试平台代码(5.3万token)及过往三次FPGA回片问题清单(0.7万token)。

模型在217秒内定位出时钟域交叉误判的根本原因,并关联到三年前某次代码合并中的注释缺失问题,该结论经工程师复核确认准确。

此类任务此前需3名资深工程师协作耗时2天,现单人可在15分钟内完成初筛。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章