DeepSeek开源OCR2模型:以视觉压缩革新长文本处理范式

源自159位全网作者

01-28 11:51

内容由AI生成

精选参考来源

1. DeepSeek又出手,开源OCR-2

2. #DeepSeek开源OCR2新模型# DeepSeek也发布了OCR 2 模型。DeepSeek-OCR 2 最大的特点是会把文档理解问题描述为一种视觉因果流:图像里的信息并不总按从左上到右下的栅格顺序被有效读取,更接近人类阅读的是由版面语义驱动的动态扫视路径。用这种方法后,在 token 数不变的情况下可承载更多有效信息,所以该模型的一个很大的特点是在相同或更低的视觉 token 上限下,表现出更强的整体解析能力。不得不说deepseek还总是能玩出一些新花样的。。

3. 全新开源的DeepSeek-OCR,可能是最近最惊喜的模型。

4. 文本已死,视觉当立!Karpathy狂赞DeepSeek新模型,终结分词器时代

5. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

6. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

7. 如何评价DeepSeek-OCR-2 模型?

8. #DeepSeek新模型为何被夸爆#DeepSeek-OCR 以其革命性技术突破,解决了大模型处理长文本的算力难题。它通过“上下文光学压缩”思路,将文本“渲染”成图像,再用少量视觉 Token 存储信息,大幅压缩计算量。这种创新方法不仅节省了算力,还提高了准确率和效率。DeepSeek-OCR 还模拟人类认知,提出了动态信息衰减策略:近期记忆→高分辨率图像(如 800+视觉Token),保留细节;远期记忆→低分辨率图像(如 64Token),自然模糊化。这种机制让 AI 像人类一样“选择性遗忘”,在保证核心语义的同时无限扩展上下文容量,为超长对话、文档处理提供了全新路径。此外,DeepSeek-OCR 模型设计精巧,具有小参数量、高性能的架构创新。它采用“局部特征→卷积压缩→全局理解”三段式架构,减少冗余视觉 Token 数量;支持多分辨率输入,从 Tiny(512×512)到 Gundam(动态分块),灵活适配不同场景需求;端到端能力强大,不仅能识别文字,还可解析表格、公式、化学结构等复杂内容,输出 Markdown/HTML 结构化文本。最后,DeepSeek-OCR 的开源引爆了生态,吸引了众多开发者参与。 deepseek新模型为何被夸爆

9. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

10. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

11. DeepSeek R2秘密武器曝光!梁文锋刚拿下顶级大奖的技术,让AI读长文速度狂飙11倍

12. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

13. #DeepSeek新模型为何被夸爆#因为这一次又是一个突破,让大家看到了上下文压缩的可行性。所谓“光学压缩”,就是直接把文本转成图像,因为一张图能包含大量的文字信息,并且用的 Token 还少,用视觉模态来给文本信息瘦身。OCR 适合验证这个思路,因为它本身就是在做视觉到文本的转换。论文显示,DeepSeek-OCR 的压缩率能达到 10 倍,OCR 准确率还能保持在 97% 以上。也就是说,如何提升大规模文本处理与智能体系统的计算效率,Deepseek又给出了一个新的思考方向。对视觉语言模型与大语言模型的发展来说,都有推动作用。

14. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

15. DeepSeek团队发布视觉压缩OCR模型,哪些信息和技术亮点值得关注?

16. 【DeepSeek团队开源新模型DeepSeek-OCR:少量视觉token完成海量文本压缩】10月21日消息,20日晚,DeepSeek-AI 团队发布《DeepSeek-OCR:Contexts Optical Compression》论文,提出利用视觉模态压缩长文本上下文的新方法。Hugging Face 页面显示,该模型的参数量为3B。根据介绍,此次开源的DeepSeek-OCR由两个部分组成:核心编码器 DeepEncoder 和解码器 DeepSeek3B-MoE-A570M。DeepEncoder 专为在高分辨率输入下保持低计算激活而设计,同时实现高压缩比,以控制视觉 token 数量在可管理的范围内。实验显示,当文本 token 数量不超过视觉 token 的 10 倍(压缩比低于 10×)时,模型的 OCR 精度可达 97%;即便压缩比提高到 20×,准确率仍保持约 60%,展现出在历史文档长上下文压缩和大语言模型记忆机制研究中的巨大潜力。DeepSeek-OCR 同时具备较高的实际应用价值。

17. 如何评价DeepSeek-OCR-2 模型?

18. #DeepSeek开源OCR2新模型#DeepSeek开源新模型OCR 2。基准测试:在OmniDocBench v1.5 上,DeepSeek-OCR 2 的整体性能达到 91.09%,相比初代基线提升了 3.73%。有意思的是抛弃了上一代 DeepEncoder 中使用的 CLIP 模块,改用Qwen2-0.5B架构替代。

19. #DeepSeek新模型为何被夸爆#DeepSeek 刚刚做了一些疯狂的事情。他们建立了一个 OCR 系统,将长文本压缩成视觉标记,将段落转换成像素。他们的模型 DeepSeek-OCR 在 10 倍压缩下解码精度可达 97%,即使在 20 倍压缩下也能保持 60% 的准确率。这意味着一张图像仅需 LLM 所需 token 的一小部分即可表示整篇文档。更疯狂?它击败了 GOT-OCR2.0 和 MinerU2.0,同时使用的令牌减少了 60 倍,并且一台 A100 处理器每天可以处理 20 万页以上的数据。这可以解决人工智能最大的问题之一:长上下文效率低下。模型可能很快就不会再为更长的序列支付更多费用,而是看到文本而不是阅读文本。上下文压缩的未来可能根本不是文本的。可能是光学的👁️github. com/deepseek-ai/DeepSeek-OCR#ai生活指南#

20. DeepSeek-OCR一开始以为是又一个普通的OCR模型,认真看了下论文,发现其重点是压缩,可以有助于LLM或者Agent的记忆管理。DeepSeek-AI 团队提出了一种全新的Contexts Optical Compression 方法,核心思想是:利用视觉模态作为一种高效的文本压缩媒介,以图像形式表示长文本,从而大幅减少LLM处理长上下文的计算负担。DeepSeek-OCR 首次验证了将文本信息以视觉形式进行高效压缩与恢复的可行性,在 10× 压缩下仍能近乎无损地还原文本。1. 研究动机当前LLM在处理长文本时面临计算量随序列长度平方增长的问题。论文提出将长文本转化为图像,让视觉模型(VLM)对其进行编码,用较少的视觉 token 表示大量文本信息,实现“以视觉压缩文本”的思路。这种“光学压缩”既能显著减少 token 数量,又可能启发 LLM 的长期记忆与遗忘机制研究。2. 模型架构DeepSeek-OCR 由两部分组成:(1)DeepEncoder:一种新型视觉编码器,结合 SAM-base(局部注意力)与 CLIP-large(全局注意力),中间加入 16× 卷积压缩模块,可在高分辨率下保持低激活内存并显著减少视觉 token。(2)DeepSeek-3B-MoE 解码器:基于 Mixture-of-Experts 架构,推理时仅激活 570M 参数,用于从视觉 latent token 重建原始文本。3. 多分辨率与模式支持DeepEncoder 支持多种输入模式(Tiny、Small、Base、Large、Gundam),对应不同分辨率与视觉 token 数,方便在研究不同压缩率或实际应用时灵活选择。例如 Gundam 模式可解析超高分辨率文档(如报纸),最高支持动态拼图式输入。4. 视觉遗忘机制作者提出“视觉化遗忘机制”假设:可以通过逐步缩小图像分辨率模拟人类记忆衰减过程,实现“信息随时间模糊化”的长期上下文管理。光学上下文压缩或可成为未来 LLM 无限上下文架构的关键方向。项目:github.com/deepseek-ai/DeepSeek-OCR#人工智能##程序员#

21. 如何评价DeepSeek-OCR-2 模型?

22. 为什么别人用 DevPod 秒启 DeepSeek-OCR,你还在装环境?

23. DeepSeek发布V3.2-Exp:引入DSA、价格腰斩,为V4、R2铺路

24. #DeepSeek开源OCR2新模型#那个“国产大模型黑马”又来卷技术了!DeepSeek-OCR2 正式开源! 如果说之前的大模型是学会了“聊天”,那么 DeepSeek-OCR2 则是进化出了“超级视力”。为什么 OCR 需要“进化”?传统的文字识别最怕三件事:乱如麻的表格、复杂的数学公式、还有那些排版极其离谱的PDF扫描件。 过去我们用 OCR,往往识别出来是一堆乱码。DeepSeek-OCR2 的核心在于它不再只是“认字”,而是通过视觉语言模型架构(VLM)在“理解排版”。 这次发布有哪些硬核突破?高分辨率感知:支持超大图输入,再小的字也看得清。结构化处理:不管是多复杂的嵌套表格,还是写满满的试卷,它能直接输出清爽的 Markdown 或 JSON 格式,直接进文档,不用二次修改。开源福利:DeepSeek 再次发挥“卷王”本色,性能对标顶尖模型,却把代码和权重都开源了。对于开发者来说,这简直是年度最强生产力礼包!从“看得见”到“看得懂”:这意味着,未来我们拍一张财务报表、一张手绘原型图、甚至是一张写满公式的黑板,AI 都能秒变精准的数字化文档。这种“生产力解放”,才是大模型落地最实在的样貌。

25. #微博声浪计划##听见微博##DeepSeek新模型为何被夸爆# DeepSeek - OCR模型在全球AI领域广受赞誉。它从技术、效率等维度实现显著突破,解决长文本算力困局,提升工程效率,重构认知范式,推动开源生态发展,彰显中国AI自主创新能力。 马头arkey的微博音频

26. #DeepSeek开源OCR2新模型# DeepSeek-OCR 2实测:复杂文档识别终于能用明白啦!#HOW I AI#AI看图识字界又搞大事了!DeepSeek这次不更大模型,直接甩出DeepSeek-OCR 2,还带了份技术报告。刚看到“准确率提升3.73%”,我心里还嘀咕:就这?结果看完技术细节,直接被打脸!先说说传统OCR有多坑——跟个不会变通的机器人似的,只能从左到右、从上到下硬扫。表格错位、文档倾斜、中英文混排?直接歇菜,识别结果错得离谱。但DeepSeek-OCR 2换了个聪明思路,跟人看书一模一样:先搞懂整页文档的逻辑关系,再决定哪里该仔细看,不重要的地方快速过,重点区域反复核对。这波操作全靠它的DeepEncoder V2,不得不说,真的懂用户需求!这次更新的6个功能,每一个都戳中痛点!纯文字提取不管版面多乱,都能把字扒得干干净净;版面格式保留能还原段落层级,不用重新排版;图表解析更绝,直接把表格识别成可编辑的结构化数据,不是没用的图片;图片语义描述能给图写段人话说明;元素定位能精准找到发票金额、合同甲方这些关键信息;最惊喜的是Markdown转化,我拿扫描版PDF论文测试,公式没丢、段落没乱,写综述的朋友直接狂喜!别觉得3.73%的提升不起眼!OCR领域早就卷成红海了,在已经很高的基准上再提分,说明真的在极端场景下下了功夫。想想那些银行对账单、医院化验报告、八几年的老论文扫描件,还有你斜着拍的白板笔记——光线不均、排版杂乱、多语言混排,传统OCR错误率能飙到两位数,而DeepSeek-OCR 2就是来解决这些麻烦的。更良心的是,技术报告和模型权重都开源了,大家可以自己验证效果。平时要处理扫描件、发票、论文笔记的朋友,真的可以试试!建议先拿你最头疼的那类文档测一测,再决定要不要加到工作流里。话说回来,你平时处理文档最烦啥场景?是歪掉的表格,还是模糊的老文件?快来试试DeepSeek-OCR 2,说不定能解决你的大难题!

27. DeepSeek-OCR 2大模型开源,重塑文档AI的认知逻辑

28. DeepSeek-OCR开源:10倍压缩+97%精度,A100日处理20万页数据,更是大模型的 “记忆革命”

29. 刚刚,DeepSeek又探索新架构了,开源OCR 2

30. DeepSeek写的考勤表统计公式,也太牛了吧!

31. #DeepSeek开源OCR2新模型#客观说,DeepSeek这次的OCR2新模型确实有实打实的进步。核心升级还是挺戳我们需求的,之前用OCR识别PDF、复杂表格,要么读得颠三倒四,要么老重复内容,改起来费劲。这次新模型换了架构,确实能感觉出来它能按意思梳理内容,跟人读东西似的,准确率也提了3个多百分点,重复的情况也少了。关键还开源了,不管是干活儿用还是开发者拿去改,都挺方便。不过要是遇到模糊图片、奇怪字体,能不能一直这么稳还不好说,得看实际用下来的情况。但总的来说,这升级确实解决了不少实际问题。

32. DeepSeek新模型被硅谷夸疯了!

33. #微博声浪计划##听见微博# 近期,DeepSeek新开源模型DeepSeek-OCR火爆技术圈。它凭借五大突破,在技术、效率等多方面带来变革。从视觉压缩到效率革命,从国际认可到开源生态,#DeepSeek新模型为何被夸爆# ,快来一探究竟! 馬太黎的微博音频

34. DeepSeek-OCR实战(02)

35. DeepSeek-OCR

36. DeepSeek新模型DeepSeek-OCR很有意思

37. DeepSeek-OCR

38. DeepSeek开源DeepSeek-OCR模型

39. DeepSeek正式发布全新多模态模型DeepSeek-OCR

40. 刚刚,DeepSeek 又发新模型DeepSeek-OCR,小而美玩出新高度!

41. DeepSeek团队发布新型视觉压缩模型DeepSeek-OCR

42. DeepSeek-OCR本地部署教程

43. DeepSeek-OCR – DeepSeek团队开源的视觉语

44. DeepSeek团队开源视觉语言模型DeepSeek-OCR

45. 尝试使用DeepSeek-OCR

46. 刚刚DeepSeek开源新模型DeepSeek-OCR

47. OCR界的"双雄对决"

48. DeepSeek-OCR模型部署使用

49. 为什么别人用 DevPod 秒启 DeepSeek-OCR,你还在装环境?

50. DeepseekOCR到底做了什么?

51. 热点关注丨DeepSeek新模型被硅谷夸疯了!用二维视觉压缩一维文字,单GPU能跑,“谷歌核心机密被开源”

52. GitHub一夜爆火!DeepSeek-OCR

53. DeepSeek-OCR

54. deepseek发布deepseek-ocr,支持超长上下文输入、多格式解析、视觉理解、多格式输出,识别精度超高~

55. DeepSeek-OCR

56. DeepSeek-OCR

57. deepseek团队又开源了一个颠覆性的项目-DeepSeek-OCR

58. DeepSeek-OCR 论文解读

59. DeepSeek-OCR

60. DeepSeek-OCR论文解读

61. DeepSeek也做OCR了, 这次不是识字这么简单

62. DeepSeek-OCR横空出世

63. 你可能压根用不上 DeepSeek-OCR

64. OCR的新高度?PaddleOCR-VL 与 DeepSeek-OCR 的技术与应用横评

65. 对决!PaddleOCR-VL和DeepSeek实战评测

66. 仅0.9B参数 百度OCR如何打败参数三倍的对手DeepSeek-OCR

67. DeepSeek火了,行业基石PaddleOCR藏不住了

68. DeepSeek-OCR与PaddleOCR实测对比!

69. OCR的“文艺复兴”

70. 用 PaddleOCR-VL + DeepSeek-OCR 搭了个真·免费 OCR 服务

71. DeepSeek 最新开源OCR模型,实测,不如百度Paddle

72. Langchain1.0实战

73. 论文陪读系列 | DeepSeek-OCR 模型 一图胜千言

74. 教程上新丨Deepseek-OCR 以极少视觉 token 数在端到端模型中实现 SOTA

75. 3B参数量掀翻OCR战场

76. 免费体验!优刻得极速部署DeepSeek-OCR

77. 全网首发!适配国产芯片的 DeepSeek-OCR 已上线模力方舟

78. 30亿参数破局!DeepSeek-OCR以视觉压缩术攻克长文档算力难题,登顶OmniDocBench

79. DeepSeek-OCR是长文本理解未来方向?中科院VTCBench给出答案

80. 0day适配国产算力!DeepSeek-OCR上线超算互联网,免费在线推理

81. DeepSeek-OCR技术深度解析

82. 企业级 OCR 新基建

83. 当其他AI还在“认字”时,DeepSeek-OCR已经学会“看书”了

84. DeepSeek-OCR

85. DeepSeek-OCR 研究与实测

86. DeepSeek-OCR-WebUI

87. DeepSeek-OCR-Web-UI

88. DeepSeek-OCR-Web-UI

89. DeepSeek-OCR + WebUI + Docker

90. DeepSeek-OCR

91. DeepSeek-OCR

92. 干掉tokenizer!DeepSeek-OCR杀疯了~

93. 长文本处理的颠覆者?DeepSeek-OCR

94. DeepSeek-OCR 如何使用?详细教程指南

95. DeepSeek立大功!这款离线OCR神器彻底治愈你的“文档隐私焦虑”

96. 太强了!DeepSeek刚刚开源新模型,用视觉方式压缩一切

97. DeepSeek再开源3B-MoE-OCR模型,视觉压缩高达20倍,支持复杂图表解析等多模态能力!

98. 端到端的多模态文档解析模型-DeepSeek-OCR架构、数据、训练方法

99. Github新星

100. DeepSeek 再开源

101. DeepSeek新模型上线,AI的JPEG时刻来了?!

102. 使用Python调用 DeepSeek-OCR 模型对pdf进行结构化的文本识别

103. Karpathy点赞,DeepSeek-OCR究竟强在哪?

104. DeepSeek-OCR刷爆全网,已开源!

105. DeepSeek-OCR

106. 多模态大模型-DeepSeek-OCR

107. 不卷长度卷压缩!DeepSeek新研究用“一张图”实现文本10倍高效压缩

108. 【Github热门项目】DeepSeek-OCR项目上线即突破7k+星!突破10倍无损压缩,重新定义文本-视觉信息处理

109. 详解DeepSeek-OCR

110. 千问 LLM 之一百零三

111. 文档处理的 “像素魔法”!Deepseek-OCR 开源

112. DeepSeekOCR,打着OCR旗号的下一代LLM Encoder

113. 刚刚,DeepSeek又探索新架构了,开源OCR 2

114. Deepseek V4的最后一块拼图来了?全新OCR架构超越视觉压缩

115. DeepSeek-OCR 2大模型开源,重塑文档AI的认知逻辑

116. DeepSeek再次升级,推出OCR模型,纸质档案秒变电子数据!

117. DeepSeek-OCR

118. DeepSeek-OCR 部署实践:基于 Rust 的高性能本地 OCR 服务

119. DeepSeek-OCR vs PaddleOCR-VL

120. LLM文档解析技术:DeepSeek-OCR

121. DeepSeek-OCR 是上下文光学压缩多模态识别模型

122. Deepseek 团队开源 3B DeepSeek-OCR的

123. DeepSeek 刚刚开源 DeepSeek-OCR,可以将图片内容转换为文本或者结构化数据,附开源git

124. DeepSeek-OCR 学习与思考

125. DeepSeek-OCR 模型 BitaHub 平台快速部署教程

126. 刚刚DeepSeek-OCR 开源,冲击百度PaddelOCR

127. DeepSeek-OCR for Mac:开源适配,从0到1的智能升级!

128. 一键从 PDF 到 可视化大屏 :基于 DeepSeek-OCR 的多模态数据分析 Agent 实战

129. DeepSeek-OCR | 光学压缩长文本

130. DeepSeek-OCR多模态数据分析Agent实战

131. 3分钟搞定DeepSeek-OCR安装!

132. DeepSeek OCR Tech Report-“一图胜千言”

133. 「DeepSeek-OCR」DeepSeek开源新模型,爆🔥内含中英双语论文

134. 只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。

135. 谁是OCR王者?MinerU、PaddleOCR、DeepSeek-OCR 实测对比,集成一个多模态PDF解析系统

136. DeepSeek-OCR-Web:从 PDF 到图表,AI 驱动的文档解析新标杆

137. Deepseek-OCR上手体验

138. deepseek-ocr及其他ocr横型衍生应用的思考

139. DeepSeek OCR 使用图像压缩上下文

140. DeepSeek-OCR降本增效,10×暴力压缩还能读得清

141. DS发布DeepSeek-OCR:上下文视觉压缩

142. 从文本到视觉token:DeepSeek-OCR 7-20×压缩率的底层架构揭秘

143. DeepSeek 和百度,把 OCR 推到了新水准

144. DeepSeek-OCR实战(06):SpringBoot应用接入

145. DeepSeek-OCR解析 DeepSeek-OCR 旨在通过将长文本内容压缩为视觉表示来解决大型语言模型(LLM)处理长文本时的计算挑战。该模型由一个高效的 DeepEncoder 和一个 DeepSeek3B-MoE 解码器组成,实验证明在压缩比小于 10 倍时,其 OCR 精度可达到 97% 左右。报告讨论了 DeepSeek-OCR 在不同分辨率模式下的架构和性能,并在 OmniDocBench 等基准测试中展示了其 最先进的实际性能,它以更少的视觉标记超越了许多现有模型。这项研究为利用视觉模态进行 长上下文处理和模拟记忆遗忘机制 提供了有前景的方向。 #Deepseek

146. DeepSeek-OCR本地部署实战

147. DeepSeek-OCR-WebUI重新定义了OCR大模型

148. “视觉处理/压缩文字”非 DeepSeek-OCR首创

149. 影音阅读党福音:自动同步字幕、搭建漫画服,还有DeepSeek-OCR和视频搬运神器

150. 部署Deepseek-orc的详细步骤

151. 告别PDF乱码错版!DeepSeek OCR驱动、MIT开源,专业原样转换扫描版 PDF 工具

152. DeepSeeek OCR解析与百度Paddle OCR实测

153. 使用 Claude Code 让 DeepSeek-OCR 在 NVIDIA Spark 上运行

154. DeepSeek-OCR:PDF 转 Markdown 工具

155. DeepSeek-OCR 想要实现的东西,其实 Qwen3-VL 已经具备了

156. 妙啊!用图像来存文本上下文?DeepSeek OCR - It's NOT about the OCR

157. 快速部署DeepSeek-OCR教程

158. DeepSeek团队开源新模型DeepSeek-OCR:少量视觉tok

159. DeepSeek-OCR速度炸裂实测

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章