DeepSeek的新模型Model1在FlashMLA代码库中悄然现身,随后又从公开文档中被移除。这一系列操作暗示着一个针对SM100硬件优化的新架构正在低调准备中,它可能带来FP8 KV量化等关键性能提升,为AI领域带来了新的期待。
智能速览
DeepSeek新模型Model1现身FlashMLA代码库。
该模型支持额外KV与动态topk功能。
引入FP8 KV量化,并针对SM100硬件优化。
公开文档曾短暂提及Model1,随后又被删除。
精华内容
通过追踪FlashMLA代码库的提交记录,可以窥见DeepSeek在底层架构上的最新探索,Model1的出现并非偶然。
代码现身
2026年1月16日,FlashMLA代码库的一次重要提交中,首次引入了代号为MODEL1的新模型类型。这次提交并非简单的代码重构,而是围绕MODEL1构建了一套完整的技术链路,涵盖了从参数结构定义、解码调度机制,到FP8 KV量化布局和全面的测试覆盖,显示出其在工程上的成熟度。
技术特性
MODEL1模型在设计上具备多项前沿特性。它支持额外的键值(KV)存储和动态topk机制,能够更灵活地处理复杂推理任务。尤为关键的是,该模型针对SM100硬件进行了专门优化,并引入了FP8 KV量化技术,这有望显著提升内存效率和计算速度,降低大模型部署成本。
文档迷踪
一个引人关注的细节是,在1月20日的后续提交中,开发者删除了公开接口文档里关于MODEL1的所有说明。这种“先增后删”的操作,通常意味着项目在正式发布前的低调调整或策略性保密。这进一步暗示MODEL1可能是一个仍在内部验证、尚未准备好公之于众的重量级项目。
Model1在代码中的短暂现身,为外界提供了一个观察DeepSeek技术路线的独特窗口。这不仅是底层硬件与算法协同优化的一个范例,也预示着未来大模型在效率和性能上的新突破。它的最终形态,值得我们持续关注。