DeepSeek新年四连发:重塑AI架构,让大模型更稳、更快、更省

源自50位全网作者

01-02 07:28

开年伊始,人工智能公司DeepSeek接连发布重磅研究论文,引发业界广泛关注。这些研究并非简单地追逐模型参数的增长,而是深入AI架构的底层,针对大规模模型训练中的稳定性、效率和推理能力等核心痛点,提出了一系列创新解决方案。

最新的一篇论文于元旦发布,由创始人梁文锋参与署名,提出了一种名为“流形约束超连接”(mHC)的全新神经网络架构。这项研究旨在解决一个困扰大模型训练的顽固问题。过去,为了提升模型性能,研究者们尝试了“超连接”(HC)技术,即拓宽网络中的信息通道。这好比将原来的一条数据管道扩建成多条并行管道,虽然增强了信息处理能力,但也带来了严重隐患:由于缺乏约束,信息在多层传递中容易被无限放大或衰减,导致训练过程极不稳定,甚至崩溃。

DeepSeek新年四连发:重塑AI架构,让大模型更稳、更快、更省

DeepSeek提出的mHC架构,巧妙地解决了这一矛盾。它沿用了拓宽通道的设计,但引入了一套“交通规则”——通过名为“双随机矩阵流形”的数学结构进行约束。一个通俗的比喻是,传统的超连接就像一个可以随意调节音量的调音台,很容易导致声音失真或消失;而mHC则好比一个总音量恒定的调音台,你可以调整不同音轨的分配,但整体能量保持不变。这种设计恢复了传统残差连接的“恒等映射”特性,确保了信号在深层网络中稳定传播。实验证明,mHC在仅增加约6.7%的训练时间开销下,就实现了显著的性能提升和卓越的训练稳定性,为更大规模模型的开发铺平了道路。

mHC的发布只是DeepSeek近期一系列技术突破的缩影。不久前,其关于DeepSeek-R1推理模型的研究成果登上了国际顶级期刊《自然》(Nature)的封面。这不仅是中国大模型研究首次获此殊荣,也标志着主流大语言模型首次通过完整的同行评审并发表于权威期刊,打破了AI行业长期以来依赖技术博客和排行榜发布成果、缺乏独立验证的“黑箱”模式。《自然》杂志对此评价称,这一空白“终于被DeepSeek打破”。该论文详细披露了仅靠强化学习(RL)就能激发大模型复杂推理能力的方法,并公开了其训练成本远低于业界普遍预期的数字,挑战了“只有巨额投入才能打造顶级AI”的传统认知。

除了在模型推理和架构稳定性上取得进展,DeepSeek还针对大模型处理长文本的效率瓶颈,发布了另外两项关键研究。

DeepSeek新年四连发:重塑AI架构,让大模型更稳、更快、更省

一项是名为“上下文光学压缩”(Contexts Optical Compression)的创新思路,体现在其DeepSeek-OCR模型中。面对长文本输入导致计算量和内存需求呈指数级增长的难题,DeepSeek反其道而行之:不再让模型逐字“阅读”文本,而是先将整页文字渲染成一张图像,再让视觉模型去“看图识字”。由于图像能以更少的“视觉Token”包含海量文字信息,这种方法实现了惊人的压缩效果。实验数据显示,在10倍压缩率下,文字识别准确率仍能保持在97%。这一思路不仅为OCR(光学字符识别)提供了新范式,更被特斯拉前AI总监Andrej Karpathy等专家看好,认为其可能从根本上改变AI处理信息的方式,为解决超长上下文问题开辟了全新路径。

DeepSeek新年四连发:重塑AI架构,让大模型更稳、更快、更省

另一项则是DeepSeek稀疏注意力(DSA)机制,其理论基础源自北大与DeepSeek合作并获得ACL 2024(注:原文有2025年的笔误)最佳论文奖的“原生稀疏注意力”(NSA)研究。该技术通过一个“闪电索引器”快速定位文本中的关键信息节点,让模型只与这些少数关键节点进行精细的注意力计算,从而将处理长文本的计算复杂度从平方级大幅降低到接近线性级。这一机制已应用于DeepSeek-V3.2等新模型中,在几乎不损失性能的前提下,显著提升了长文本的训练和推理效率。

DeepSeek新年四连发:重塑AI架构,让大模型更稳、更快、更省

综合来看,DeepSeek开年发布的系列新论文,展现出一条清晰的技术路线:聚焦于AI基础架构的核心问题,通过底层算法和工程优化,系统性地解决模型训练的稳定性、效率和可扩展性难题。从改造残差连接到革新注意力机制,再到探索全新的信息压缩范式,这些研究共同指向一个目标——构建更强大、更高效、更经济的下一代基础模型。

内容由AI生成

精选参考来源

1. DeepSeek,最新发布!

DeepSeek,最新发布! DeepSeek,最新发布!证券时报1767265393 DeepSeek发布新论文,梁文锋参与署名。1月1日消息,DeepSeek发布了一篇新论文,提出了一种名为mHC

2. 独家!DeepSeek新模型上线,全新注意力机制基于北大ACL最佳论文

独家!DeepSeek新模型上线,全新注意力机制基于北大ACL最佳论文独家!DeepSeek新模型上线,全新注意力机制基于北大ACL最佳论文康少品百科1759240080 还在为大模型处理长文本的

3. #DeepSeek元旦新论文#跨年夜的代码与星光共闪耀!DeepSeek在2026年第一天重磅发布新论文,创始人梁文锋领...

#DeepSeek元旦新论文#跨年夜的代码与星光共闪耀!DeepSeek在2026年第一天重磅发布新论文,创始人梁文锋领... 跨年夜的代码与星光共闪耀!DeepSeek在2026年第一天重磅发布新论

4. DeepSeek12月31日发布的新论文《mHC: Manifold-Constrained Hyper-Connect...

DeepSeek12月31日发布的新论文《mHC: Manifold-Constrained Hyper-Connect... DeepSeek12月31日发布的新论文《mHC: Manifold-C

5. DeepSeek-V3.2:算力减半,性能不减

DeepSeek-V3.2:算力减半,性能不减 💰 提个问题:如何在保持模型性能的同时,让推理成本降一半? 答案就在DeepSeek-V3.2的最新论文里! 🔑 核心突破:稀疏注意力(DSA)

6. 论文分享: DeepSeek新作 DeepSeek-OCR: Contexts Optical Compression

Hello大家好,今天继续给大家分享一篇文章这篇文章的话是DeepSeq的一个新作刚刚挂在Archive上大概10月21号的时候挂在Archive上的一篇文章叫DeepSeq OCR Context

7. 撞车DeepSeek-OCR,智谱GLM新论文Glyph

你想象一下一个AI它不是一个字一个字底去读而是就看一张图就能把一整本书给看懂了是不是听起来特别科幻但咱们今天要聊的这个新研究叫Glyph它真的就在把这个想法变成现实而且它可能从根本上就解决了AI现在面

8. 整个飞机上的人都在看deepseek新发的论文

整个飞机上的人都在看deepseek新发的论文Google高级AI专家Alex Polozov表示,他正在飞往圣地亚哥的航班上(应该是前往参加NeurIPS 2025),大约30%的乘客都在盯着同一个

9. DeepSeek团队发布视觉压缩OCR模型 DeepSeek-AI团队发布《DeepSeek-OCR: Contex...

DeepSeek团队发布视觉压缩OCR模型 DeepSeek-AI团队发布《DeepSeek-OCR: Contex... DeepSeek团队发布视觉压缩OCR模型 DeepSeek-AI团

10. #模型时代##DeepSeek元旦新论文#DeepSeek 开年第一篇论文说了什么?就像R1发布选择了春节,DeepSe...

#模型时代##DeepSeek元旦新论文#DeepSeek 开年第一篇论文说了什么?就像R1发布选择了春节,DeepSe... DeepSeek 开年第一篇论文说了什么?就像R1发布选择了春节,Dee

11. DeepSeek开年发布新论文:提出全新mHC架构,梁文锋现身作者名单

DeepSeek开年发布新论文:提出全新mHC架构,梁文锋现身作者名单 DeepSeek开年发布新论文:提出全新mHC架构,梁文锋现身作者名单IT之家1767258524 IT之家 1 月 1 日消息

12. DeepSeek开年炸场!梁文锋又发论文了,一如既往地强

DeepSeek开年炸场!梁文锋又发论文了,一如既往地强 DeepSeek开年炸场!梁文锋又发论文了,一如既往地强智东西1767264972 智东西作者 | 江宇 王涵编辑 | 心缘智东西1月1日报道

13. 刚刚,梁文锋署名,DeepSeek元旦新论文要开启架构新篇章

刚刚,梁文锋署名,DeepSeek元旦新论文要开启架构新篇章 刚刚,梁文锋署名,DeepSeek元旦新论文要开启架构新篇章华尔街见闻1767277037 来源:机器之心新年第一天,DeepSeek 发

14. DeepSeek新年炸场!梁文锋署名论文发布

DeepSeek新年炸场!梁文锋署名论文发布 DeepSeek新年炸场!梁文锋署名论文发布第一财经1767275055 1月1日消息,DeepSeek赶在新年前发送了“贺礼”,在新论文中提出了名为mH

15. 刚刚,DeepSeek扔出大杀器,梁文锋署名!暴力优化AI架构

刚刚,DeepSeek扔出大杀器,梁文锋署名!暴力优化AI架构 刚刚,DeepSeek扔出大杀器,梁文锋署名!暴力优化AI架构新智元1767280752 编辑:编辑部【新智元导读】2026新年第一天,

16. 中国大模型首登Nature封面!DeepSeek首次披露:R1训练只花200万

中国大模型首登Nature封面!DeepSeek首次披露:R1训练只花200万 中国大模型首登Nature封面!DeepSeek首次披露:R1训练只花200万量子位1758171539 henry 发

17. DeepSeek梁文锋论文登上Nature封面,AI大模型首次通过同行评审

DeepSeek梁文锋论文登上Nature封面,AI大模型首次通过同行评审 DeepSeek梁文锋论文登上Nature封面,AI大模型首次通过同行评审DeepTech深科技1758163993 Dee

18. 梁文锋参与的DeepSeek-R1论文登上 Nature封面,这具有什么意义?

梁文锋参与的DeepSeek-R1论文登上 Nature封面,这具有什么意义? 当看到梁文锋团队的DeepSeek-R1论文登上Nature的消息,我直接从椅子上跳起来。作为一个在AI圈混了快五年的老

19. DeepSeek,最新发布!

DeepSeek,最新发布! DeepSeek,最新发布!京报网1767266784 DeepSeek发布新论文,梁文锋参与署名。1月1日消息,DeepSeek发布了一篇新论文,提出了一种名为mHC(

20. 梁文锋参与的DeepSeek-R1论文登上 Nature封面,这具有什么意义?

梁文锋参与的DeepSeek-R1论文登上 Nature封面,这具有什么意义? 在nature正刊发论文,而且nature封面论文,这已经是学术界论文的天花板了。但是我觉得DeepSeek R1值得这

21. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注? 今天DeepSeek-OCR在AI圈被夸爆了,什么原因呢? 先上总结:“把一大段文字先‘拍成照片’,再用视觉模型去‘看图识字’

22. DeepSeek首度公开R1模型训练成本仅为29.4万美元,“美国同行开始质疑自己的战略”

DeepSeek首度公开R1模型训练成本仅为29.4万美元,“美国同行开始质疑自己的战略” DeepSeek首度公开R1模型训练成本仅为29.4万美元,“美国同行开始质疑自己的战略”观察者网17582

23. DeepSeek-R1能够登上《自然》(Nature)封面,主要源于其突破性的技术创新、严格的科学验证及重大的学术影响力...

DeepSeek-R1能够登上《自然》(Nature)封面,主要源于其突破性的技术创新、严格的科学验证及重大的学术影响力... DeepSeek-R1能够登上《自然》(Nature)封面,主要源于其突

24. #DeepSeek团队开源新模型#DeepSeek团队开源的3B参数模型DeepSeek-OCR,以视觉模态压缩长文本的...

#DeepSeek团队开源新模型#DeepSeek团队开源的3B参数模型DeepSeek-OCR,以视觉模态压缩长文本的... DeepSeek团队开源的3B参数模型DeepSeek-OCR,以视觉模

25. #DeepSeek元旦新论文#它没去追逐那些宏大叙事,而是用了一个相当“工程师”的思路去解决大模型训练中一个具体又顽固的...

#DeepSeek元旦新论文#它没去追逐那些宏大叙事,而是用了一个相当“工程师”的思路去解决大模型训练中一个具体又顽固的... 它没去追逐那些宏大叙事,而是用了一个相当“工程师”的思路去解决大模型训练

26. #DeepSeek新模型为何被夸爆#因为这一次又是一个突破,让大家看到了上下文压缩的可行性。 所谓“光学压缩”,就是直...

#DeepSeek新模型为何被夸爆#因为这一次又是一个突破,让大家看到了上下文压缩的可行性。 所谓“光学压缩”,就是直... 因为这一次又是一个突破,让大家看到了上下文压缩的可行性。 所谓“光学压缩”

27. DeepSeek最新发布的DeepSeek-OCR方案非常值得关注。他们探索了如何用视觉编码器提升大语言模型(LLM)处...

DeepSeek最新发布的DeepSeek-OCR方案非常值得关注。他们探索了如何用视觉编码器提升大语言模型(LLM)处... DeepSeek最新发布的DeepSeek-OCR方案非常值得关注。他们

28. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注? 刚大概扫了一遍论文,简单说说:这个工作不是在单纯提高 OCR 的准确率,而是在尝试解决一个更大的问题——大模型的上下文瓶颈。它

29. #模型时代##DeepSeek新模型为何被夸爆# DeepSeek今天的新论文《利用图像化上下文压缩,实现长文本的高...

#模型时代##DeepSeek新模型为何被夸爆# DeepSeek今天的新论文《利用图像化上下文压缩,实现长文本的高... DeepSeek今天的新论文《利用图像化上下文压缩,实现长文本的高效记

30. 【#DeepSeek新模型为何被夸爆#,新论文被称硅基生命进化】据新浪科技报道,近日DeepSeek再次新发布并开源的O...

【#DeepSeek新模型为何被夸爆#,新论文被称硅基生命进化】据新浪科技报道,近日DeepSeek再次新发布并开源的O... 【,新论文被称硅基生命进化】据新浪科技报道,近日DeepSeek再次新发

31. 刚刚,北大DeepSeek斩获ACL 2025最佳论文!全网首发一作演讲

刚刚,北大DeepSeek斩获ACL 2025最佳论文!全网首发一作演讲 刚刚,北大DeepSeek斩获ACL 2025最佳论文!全网首发一作演讲新智元1753901391 编辑:定慧 好困【新智元导

32. DeepSeek改造何恺明残差连接!梁文峰亲自署名,十年首次重大升级

DeepSeek改造何恺明残差连接!梁文峰亲自署名,十年首次重大升级 DeepSeek改造何恺明残差连接!梁文峰亲自署名,十年首次重大升级量子位1767266224 梦晨 发自 凹非寺量子位 | 公众

33. DeepSeek V3到V3.2的进化之路,一文看全

DeepSeek V3到V3.2的进化之路,一文看全 DeepSeek V3到V3.2的进化之路,一文看全机器之心Pro1765173914 机器之心编译作者:Sebastian Raschka12

34. [CV]《DeepSeek-OCR: Contexts Optical Compression》H Wei, Y Sun...

[CV]《DeepSeek-OCR: Contexts Optical Compression》H Wei, Y Sun... [CV]《DeepSeek-OCR: Contexts Optical

35. DeepSeek新模型被硅谷疯夸!用二维视觉压缩一维文字,单GPU能跑

DeepSeek新模型被硅谷疯夸!用二维视觉压缩一维文字,单GPU能跑 DeepSeek新模型被硅谷疯夸!用二维视觉压缩一维文字,单GPU能跑量子位1761003554 DeepSeek最新开源的模型

36. DeepSeek新模型“杀疯了”!用视觉压缩文字,开源即获5.7k Star,Karpathy直呼:Tokenizer必...

DeepSeek新模型“杀疯了”!用视觉压缩文字,开源即获5.7k Star,Karpathy直呼:Tokenizer必... DeepSeek新模型“杀疯了”!用视觉压缩文字,开源即获5.7k St

37. 开源和闭源模型的差距在拉大:这是 DeepSeek 论文揭示的残酷真相

开源和闭源模型的差距在拉大:这是 DeepSeek 论文揭示的残酷真相 开源和闭源模型的差距在拉大:这是 DeepSeek 论文揭示的残酷真相新浪财经1765073508 来源:市场资讯(来源:硅星人

38. 梁文锋参与的DeepSeek-R1论文登上 Nature封面,这具有什么意义?

梁文锋参与的DeepSeek-R1论文登上 Nature封面,这具有什么意义? 我最近在经历非常痛苦的论文修改环节,两个审稿人一共提了将近20个问题,有简单的比如描述不清,缺参考文献,也有复杂的,明显

39. DeepSeek被 美AI 巨头污蔑抄袭!现实疯狂打脸,反手登上世界级顶刊

DeepSeek被 美AI 巨头污蔑抄袭!现实疯狂打脸,反手登上世界级顶刊 DeepSeek被 美AI 巨头污蔑抄袭!现实疯狂打脸,反手登上世界级顶刊易霄寒1758286422 前言2025年9月17

40. 不要再膜拜 Gemini 3 Pro 了,DeepSeek V3.2 又又又重新霸榜了

不要再膜拜 Gemini 3 Pro 了,DeepSeek V3.2 又又又重新霸榜了 不要再膜拜 Gemini 3 Pro 了,DeepSeek V3.2 又又又重新霸榜了人工智能研究所176489

41. 太强了!DeepSeek刚刚开源新模型,用视觉方式压缩一切

太强了!DeepSeek刚刚开源新模型,用视觉方式压缩一切 太强了!DeepSeek刚刚开源新模型,用视觉方式压缩一切机器之心Pro1760953927 机器之心报道机器之心编辑部我们或许能通过文本到

42. 解读《DeepSeek-OCR: Contexts Optical Compression》你有没有觉得,虽然现在的AI...

解读《DeepSeek-OCR: Contexts Optical Compression》你有没有觉得,虽然现在的AI... 解读《DeepSeek-OCR: Contexts Optical Co

43. 从文字到像素:DeepSeek-OCR揭示AI下一个算力革命的方向

从文字到像素:DeepSeek-OCR揭示AI下一个算力革命的方向 从文字到像素:DeepSeek-OCR揭示AI下一个算力革命的方向智能学院1761634570 在大模型狂飙突进的时代,真正的瓶颈并

44. 🚀只有3B参数的DeepSeek-OCR击败传统视觉模型,上下文光学压缩技术+双路径编码+自适应分辨率,这个开源模型凭什么这么强?完整技术解析+部署教程+实测!3B参数轻量化模型人人都能部署! 🚀

DeepSync昨天发布了创新性的视觉语言模型DeepSync OCR这款模型它只有3B参数而且模型的全种文件只有6.67GB因为这款模型的参数比较小所以对硬件的要求就非常低我们只需要在入门级显卡上就

45. 重磅,DeepSeek再开源:视觉即压缩,100个token干翻7000个

重磅,DeepSeek再开源:视觉即压缩,100个token干翻7000个 重磅,DeepSeek再开源:视觉即压缩,100个token干翻7000个36氪1761010638 一图胜千言!Deep

46. 重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个

重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个 重磅!DeepSeek再开源:视觉即压缩,100个token干翻7000个新智元1760958768 编辑:KingHZ【新

47. DeepSeekV3.2来啦🚀🚀🚀

DeepSeekV3.2来啦🚀🚀🚀 📌 DeepSeek-V3.2 模型正式推出,分为thinking和speciale 大家可以下载。核心亮点集中在三个技术方向: 🔍 DSA 稀疏注意力机制 针对长

48. DeepSeek写论文:太实用了!10个学术指令 1天产出完整论文

DeepSeek写论文:太实用了!10个学术指令 1天产出完整论文 DeepSeek写论文:太实用了!10个学术指令 1天产出完整论文博雅简致1755097260 很多用AI辅助写论文的朋友都遇到过这

49. DeepSeek团队开源OCR新模型:少量视觉token完成海量文本压缩

DeepSeek团队开源OCR新模型:少量视觉token完成海量文本压缩 DeepSeek团队开源OCR新模型:少量视觉token完成海量文本压缩IT之家1760947298 IT之家 10 月 20

50. 智能涌现:大模型是怎么练成的-DeepSeek的

智能涌现:大模型是怎么练成的-DeepSeek的 本周我们来看智能涌现-大模型是怎么练成的(3),聊聊DeepSeek发布的第一个模型,DeepSeek-LLM-V1的前因后果。 有用户反馈,之前两期
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章