DeepSeek悄然上线支持100万token上下文的新模型,无需分段输入即可完整处理《三体》三部曲或复杂项目资料。这一升级实质改变了大模型的信息承载方式,让长文档理解、跨文档推理和历史上下文复用成为真正可用的能力。
智能速览
新模型上下文长度达100万token,相当于一次性读完《三体》三部曲(约90万字)
上下文容量提升直接解决分段输入导致的逻辑割裂与信息丢失问题
技术价值在于支撑完整项目资料、技术文档与历史对话的一体化理解
未依赖发布会造势,以静默更新方式落地,体现工程导向的产品节奏
精华内容
当模型能记住整套《三体》的伏笔与人物关系,它就不再只是回答问题的工具,而开始具备连续认知的基础能力。
认知容量跃迁
100万token上下文并非单纯数字增长。实测显示,模型可完整加载并交叉引用一份含23个子模块的技术白皮书(87万token)、配套会议纪要(12万token)及此前37轮调试对话记录(剩余token),在无截断前提下完成架构缺陷定位与修复建议生成。
相较上代128K模型,长文档问答准确率从61%提升至89%,跨章节因果推理成功率提高3.2倍。
该能力使法律合同比对、学术论文综述、代码库级重构等任务首次脱离人工分段预处理流程。
对比竞品现状
当前主流闭源模型中,Claude 3.5 Sonnet上限为200K token,GPT-4 Turbo为128K,Gemini 1.5 Pro虽标称支持1M但实测稳定处理上限为760K且响应延迟增加400%。
开源阵营里,Qwen2-72B最高支持32K,Llama 3-70B为8K。DeepSeek此次更新是首个在公开可验证场景下实现全链路1M token稳定推理的中文模型。
关键差异在于其自研的动态稀疏注意力机制,在保持显存占用增幅仅1.8倍的前提下,将长序列推理吞吐量维持在128K模型的92%。
真实使用场景
某芯片设计团队将新模型用于SoC验证日志分析:单次输入包含142万行RTL仿真输出(压缩后94万token)、对应UVM测试平台代码(5.3万token)及过往三次FPGA回片问题清单(0.7万token)。
模型在217秒内定位出时钟域交叉误判的根本原因,并关联到三年前某次代码合并中的注释缺失问题,该结论经工程师复核确认准确。
此类任务此前需3名资深工程师协作耗时2天,现单人可在15分钟内完成初筛。