去年春节DeepSeek R1模型震惊全球,今年元旦mHC架构论文的发布再次引发行业关注。本文回顾DeepSeek过去一年的技术突破,分析其开源策略与底层创新,探讨下一代模型可能带来的变革。

智能速览
元旦发布mHC全新架构,解决训练不稳定难题
2025年密集更新,R1将推理成本降至OpenAI三十分之一
坚持底层技术创新与开源策略,推动生态建设
mHC架构将信号失真降低三个数量级,提升训练效率
已有超百款应用接入,下一代模型或进一步降低成本
精华内容
从R1的一鸣惊人到mHC架构的低调发布,DeepSeek正用底层技术重塑AI行业格局,新模型值得期待。
密集技术迭代
2025年DeepSeek更新节奏极快。1月发布的R1模型,将推理成本降至OpenAI的三十分之一,性能却与之持平,迫使全球厂商降价。
5月R1-0528版本编程能力追平OpenAI o3-high。9月R1论文登上Nature封面,成为首个经顶级期刊评审的主流大模型。
12月V3.2正式版在公开测试中达到GPT-5水平。
极致开源策略
DeepSeek近期将R1论文从22页扩充至86页,详尽公开了训练细节、成本及失败尝试。这种开源程度在业内罕见,OpenAI和Meta都未做到如此透明。
DeepSeek采用MIT协议,允许商用无限制。R1发布后一个月,超15家国产芯片厂商完成适配。
这种策略使其正成为开源大模型的事实标准,形成了正向循环的生态效应。
专注底层创新
不同于其他厂商模型与应用并举,DeepSeek只做底层技术研究。创始人明确表示应用交给别人,至今其手机应用界面依然简洁。
去年的MLA架构将推理显存降至传统方案的5%到13%,元旦发布的mHC架构则解决了困扰行业十年的训练不稳定问题。
这种专注让其在技术路线上走得更远,不盲目堆叠参数。
mHC架构突破
mHC架构旨在解决神经网络越深训练越难的问题。以往方案需牺牲性能或增加成本,而mHC能在保持高性能的同时稳定训练。
论文数据显示,信号失真从3000倍降至1.6倍,降低了三个数量级。
这意味着未来可以训练更大、更深的模型,且成本更低、成功率更高,有望再次降低AI使用门槛。
DeepSeek已证明用更少资源做出更好模型的可能性,若春节前发布基于mHC架构的新一代模型,AI使用成本或将进一步降低。这种技术驱动的发展思路,将持续影响2026年的AI行业竞争格局。