视觉压缩会取代传统文本处理吗?全网观点大PK

源自107位全网作者

25-12-14

内容由AI生成

精选参考来源

1. DeepSeek-OCR

2. DeepSeek刚刚开源新模型,用视觉方式压缩一切

3. 把十万字“塞进”一张图

4. DeepSeek 发布

5. DeepSeek新突破

6. DeepSeek又出王牌模型!小而美的新模型,玩出新高度!

7. DeepSeek开源OCR模型解决大模型健忘症

8. 何必先OCR再LLM?视觉语言模型直接读图,让百页长文档信息不丢失

9. 给 LLM 的长文本“瘦身”——DeepSeek-OCR 探索视觉压缩新可能

10. 与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读长文本

11. 颠覆传统

12. 「看」能否取代「读」,为何DeepSeek-OCR 爆火的重点不在性能?

13. DeepSeek-OCR

14. Deepseek OCR 真的很有想象力啊

15. 外媒

16. 视觉压缩称王?谷歌死守AI黑科技,DeepSeek一夜开源

17. DeepSeek与智谱同日出手,将语言压缩成视觉是下一个扩展方向

18. 视觉token取代文本分词~DeepSeek-OCR

19. DeepSeek-OCR的中国式创新智慧,将加速多个行业的AI能力强化和普及

20. DeepSeek-OCR

21. DeepSeek-OCR

22. DeepSeek重磅发布

23. DeepSeek-OCR开源爆火!10倍压缩仍准97%,改写大模型记忆

24. 多模态大模型-DeepSeek-OCR

25. 超神!DeepSeek OCR创新彻底改写大模型与多模态格局!

26. 实测最新开源的DeepSeek-OCR后,我有些不一样的看法,有些话可能只有我敢说

27. DeepSeek开源的新模型,有点邪门

28. 腾讯开源 HunyuanOCR,用纯粹视觉语言模型架构,仅1B参数刷新多项高阶任务SOTA

29. 腾讯又放大招!开源原生端到端 OCR 模型,1B 参数吊打PaddleOCR!

30. OCR的新高度?PaddleOCR-VL 与 DeepSeek-OCR 的技术与应用横评

31. 只有0.9B的PaddleOCR-VL,却是现在最强的OCR模型。

32. DeepSeek-VLM

33. 震惊~视觉编码器考 90 分,套上 VLM 壳秒变 20 分

34. DeepSeek-OCR AI长文本处理新突破核心问题

35. 不止于 OCR

36. 微软发布BeMyEyes

37. 以后和你同台竞争的,除了其他人类,还有AI。 #大咖观察 #红衣聊AI #DeepSeek #人工智能 #金融

38. #DeepSeek新模型为何被夸爆#DeepSeek 刚刚做了一些疯狂的事情。他们建立了一个 OCR 系统,将长文本压缩成视觉标记,将段落转换成像素。他们的模型 DeepSeek-OCR 在 10 倍压缩下解码精度可达 97%,即使在 20 倍压缩下也能保持 60% 的准确率。这意味着一张图像仅需 LLM 所需 token 的一小部分即可表示整篇文档。更疯狂?它击败了 GOT-OCR2.0 和 MinerU2.0,同时使用的令牌减少了 60 倍,并且一台 A100 处理器每天可以处理 20 万页以上的数据。这可以解决人工智能最大的问题之一:长上下文效率低下。模型可能很快就不会再为更长的序列支付更多费用,而是看到文本而不是阅读文本。上下文压缩的未来可能根本不是文本的。可能是光学的👁️github. com/deepseek-ai/DeepSeek-OCR#ai生活指南#

39. 今年的机器人进化到哪了?我替你们去WAIC看一看 速通今年WAIC机器人展厅的四大亮点: 亮点一,更灵活! 关节自由度拉满,扭矩精度爆表,跳舞比你还丝滑。 亮点二,更聪明! 大脑装上VLA模型,看视频就能get新技能,学东西比你快。 亮点三,更好看! 告别恐怖谷,颜值逆天,微表情拿捏。 亮点四,更实用! 救援、按摩、陪打麻将,只有你想不到,没有它做不到! 准备好了吗?一个全新的机器人时代,呼啸而来! #抖音博主探秘世界人工智能大会 #AI新星计划 #人工智能 #机器人 #WAIC

40. DeepSeek新模型爆火,硅谷玩疯了 #DeepSeek团队开源新模型 DeepSeek新模型爆火,硅谷玩疯了!把文字变成图像,让AI一目十行读完一本书!这次,它真的在教AI们,怎么省算力、怎么学会“遗忘” #AI #DeepSeek

41. #DeepSeek还会推出R2吗#?从当前的信息来看,DeepSeek后续单独推出R2的可能性较低,甚至可能接近于零。这主要是基于DeepSeek-V3.1的最新发布,该模型已经引入了混合推理架构(Hybrid Inference),将原本R系列的“思考模式”(Think Mode,强调深度推理)和V系列的“非思考模式”(Non-Think Mode,强调快速响应)融合到一个模型中。这种设计让用户可以通过提示词(prompt)在同一个模型内切换模式,实现更高效的推理,而无需维护两个独立的系列。业内猜测,这标志着DeepSeek的策略转向模型架构统一,类似于OpenAI将不同能力整合到单一模型(如GPT系列)的路线。回顾历史,DeepSeek-R1于2025年1月20日发布,作为推理专精模型,性能媲美OpenAI的o1,并在5月发布了R1-0528的升级版。 但R2的发布计划从最初的4月底推迟到5月初,又因质量问题、芯片短缺和外部竞争(如Grok 3、Claude 3.7、Qwen 2.5-Max)而多次延后。 如今进入2025年8月,V3.1的推出直接“吃掉”了R1的部分能力(如数学、代码和推理蒸馏),让R2的独立存在显得可能有点多余。如果DeepSeek继续迭代V系列(如潜在的V3.5或V4),R2很可能不会以独立形式出现,而是通过V系列的更新间接实现。 当然,如果市场反馈显示混合模式不足以覆盖所有场景,或者DeepSeek面临更激烈的竞争(如国产芯片训练需求),仍有小概率重启R2,但整体趋势是融合而非分离。DeepSeek已经开始将V系列和R系列融合,V3.1的发布就是明确证据。该模型的核心亮点是混合推理架构,一个模型同时支持“思考模式”(深度推理,类似于R系列)和“非思考模式”(快速响应,类似于V系列),通过提示词无缝切换。 直接“吃掉”了R1的部分能力,如数学推理、逻辑分析和代码生成,通过蒸馏技术整合到V3基底中。 V3.1在保持低成本(MoE架构下仅激活37B参数)的同时,提升了Agent和智能体功能,思考速度更快。 #ai生活指南##ai创造营#

42. #小鹏G7Ultra首次OTA来了# 小鹏G7 Ultra 的XOS5.7.7 OTA来啦,小鹏G7系列会全量更新之前就预热过的VLA模型辅助驾驶,之前辅助驾驶视频里我提了一嘴,这里再给大家讲一讲VLA的好VLA,就是vision-language-action,本质上模拟的是人类通过视觉看到内容,合并内容含义(自然语言化),然后转化成执行指令的一种模型,现实世界人类开车的时候并不完全依赖于交规和驾照科目一里那些题目进行决策,而指引人类驾驶的大量地标,路标和标识物,则都是基于人类对于自然语言的理解来的,比如“医院附近”,“车库出口”,“施工路段”,这也是为什么最新的辅助驾驶模型无论在识别逻辑还是决策逻辑上注意力都更向“人类”的观察和思考靠近,也就是现在的VLA类模型,比如这次更新G7 Ultra上的新版本的几个例子:1,小区附近路面,双向四车道变停车场,中间留一条路,规则方案很容易把这个场景和隔壁车道堵车混淆,因为场景太多了,但是VLA就能够根据视觉看到的画面去像人类一样“思考”这个场景代表什么,输出结果指令来辅助车辆辅助驾驶的决策,比如认为这些停车+附近位置信息可能意味着鬼探头的出现,我应该提前减速,避免出来的小孩根本没有AEB的减速空间造成事故。2,这次的VLA方案在特殊⻋道识别上也非常先进,相对于传统的非强视觉模型,它能精准识别公交车道和潮汐⻋道的可⽤时间,并在未来的 OTA 更新中,实现更智能的⻋道通⾏能⼒。⽆论是早晚⾼峰,还是特殊时段,VLA 都能帮你⾼效通⾏,让出⾏更加便捷。3,这次小鹏的VLA具备链式推理能⼒(CoT)及「⻓序思考」能⼒:这意味着可以像⼈⼀样推理和“⻓序思考”:像⼈类⼀样分步骤、有逻辑地进⾏复杂的推理,处理在训练数据中从未⻅过的复杂场景,比如车道因为施工变更后会和什么行车产生冲突,这时候车辆应该如何避让等等。如此种种场景还有很多,VLA模型本质上代表着这个阶段车载算力下辅助驾驶控制逻辑的一次更拟人的提升,从过去的视觉内容大量学习找到隐含驾驶逻辑(变量)的传递更好的开车,到寻找这个驾驶逻辑的自然语言描述,通过更符合人类建设交通基础设施和交通交互的方式思考来正好的开车,G7 Ultra这次VLA的更新,实质上的走在了未来辅助驾驶发展的前列~

43. #DeepSeek新模型发布#DeepSeek-V3.2-Exp虽为实验版本,却亮出关键技术突破——DeepSeek Sparse Attention(稀疏注意力机制)。其核心价值在于针对性优化长文本处理:传统注意力机制计算复杂度随文本长度呈平方级增长,而稀疏设计通过动态筛选关键信息关联,大幅降低运算量,实现训练与推理效率双提升。尽管评测表现与V3.1持平,却在长文本场景释放了潜力。应用层面,该模型天然适配法律文书分析、学术论文精读、多轮对话历史理解等长文本需求场景。API降价50%与开源举措,更降低开发者试错成本,加速长文本AI落地。作为新一代架构过渡,它不仅验证了稀疏注意力的可行性,更以“效率不降、成本腰斩”的姿态,为行业探索大模型轻量化提供了可复制的中间路径。#秒懂热点就用智搜# 分析:【#DeepSeek新模型发布#】 DeepSeek发布Deep

44. #DeepSeek新模型为何被夸爆#救命!DeepSeek新模型把“读课文”玩成“看漫画”了家人们谁懂啊!别的AI读长文本像啃大部头,啃得CPU冒火星子还慢半拍,DeepSeek直接开脑洞——把文字变图像,让AI像刷表情包似的“扫一眼”就懂!刚上线就狂揽3.7K GitHub星、冲HuggingFace热榜第二,硅谷大佬都夸思路绝。以前处理长文档像挤牙膏,现在效率直接起飞,算力省得能多跑好几轮任务。这哪是模型更新,简直是给AI装了“速读挂”,就是不知道以后AI会不会嫌弃咱们人类读得慢了!#秒懂热点就用智搜# 分析:【#DeepSeek新模型为何被夸爆# 】DeepSeek最近推出的OCR新模型海外平台热度飙升,刚

45. #DeepSeek新模型会改变未来吗#我上手试了试这个3B参数的VLM(视觉语言模型),它不光是OCR工具,更是上下文压缩的黑科技。 用Hugging Face的transformers库,几行代码就能跑起来(支持Tiny/Small/Base/Large四种分辨率模式,从512x512到1280x1280像素)。我测试了份乱七八糟的PDF报告:手写笔记+表格+图表,输入一张图,它用DeepEncoder(基于SAM局部感知+CLIP全局聚合)压缩成仅64-100个视觉token,然后MoE解码器(活跃参数仅570M)吐出结构化Markdown。准确率高达97%(Fox基准),远超PaddleOCR,尤其在数学公式和多语言上(训练了100种语言的3000万PDF页)。 视觉输入高效,传统文本输入靠tokenizer切成1000+ token,容易丢布局(颜色、粗体、图表全废)。但这里像信息压缩饼干:一张图浓缩千言,token减10x,内存和延迟直降。Andrej Karpathy也说:“也许LLM输入永远该是像素,不是文本。” 我试了对比:纯文本模式下,处理长文档上下文窗口爆表;视觉模式下,轻松handle 20x压缩(准确率85%+)。不过缺点是高分辨率下GPU饿(A100单卡日产20万页数据还行,但本地跑需优化)。总的,视觉更保真,像给AI戴了副高清眼镜——高效,但得适应看图识字的新范式。 这模型不只变OCR,更在重塑AI感官,从读到看。未来?眼睛主导世界,token时代退场。你们怎么看?DeepSeek会是下一个LLaMA吗?[并不简单]#ai生活指南##ai创造营#

46. #DeepSeek还会推出R2吗#DeepSeek官号今日公布DeepSeek-V3.1详细更新,核心亮点中提到将采用混合推理架构,即一个模型同时支持思考模式与非思考模式,业内猜测DeepSeek可能正在将V系列与R系列模型进行融合,效仿OpenAI的路线,实现模型架构的统一。此前已有观点指出,V3.1的发布可能标志团队策略调整,市场期待的R2或不再以独立命名形式推出,而是通过V系列的持续迭代来实现

47. 百度近期开源 Qianfan-VL 系列视觉理解模型,有哪些亮点值得关注?

48. 【LMArena最新排名:视觉理解,文心5.0 Preview成最强国产模型】11月22日,备受行业关注的LMArena大模型竞技场公布最新排名结果,其中文心大模型ERNIE-5.0-Preview-1120在视觉理解榜中交出了亮眼答卷,以1206分的成绩位列国内第一,更值得关注的是,其整体水平已与Claude-Sonnet-4、GPT-5-high等国际一线大模型相当,成为国产模型在该领域与国际顶尖力量同台竞技的重要突破。在LMArena众多细分榜单中,视觉理解榜对应的应用场景并非简单的图像识别,而是工业质检、视频解析、医疗影像分析这类对模型精度和可靠性要求极高的核心领域。工业质检的任何误差都可能影响整条生产线的效率,医疗影像分析则关系到诊断的准确性,这类任务更能深度检验其底层能力。此前,国内虽有部分模型在LMArena的其他赛道展现出一定潜力,取得过不错的成绩,但在视觉理解榜这一“硬骨头”赛道上,能真正突破门槛、与国际一线模型同场比拼的却几乎没有。而文心5.0 Preview不仅成功跻身该榜单,更成为目前国内在该榜单中排名最高的模型,1206分的成绩背后,是其在视觉推理与跨模态理解能力上的扎实积累,标志着国产模型已具备在视觉任务中与国际顶尖模型抗衡的实力。文心5.0 Preview的成绩并非偶然,而是源于其独特且扎实的技术路线。作为新一代原生全模态大模型,它摒弃了业界多数多模态模型的后期融合模式,而从训练之初就将语言、图像、视频、音频等多模态数据统一,让多模态特征充分交互、协同优化,从根源上实现了原生的全模态统一理解与生成,而非简单的功能叠加,这也为其在视觉理解任务中的出色表现奠定了基础。除了核心技术路线的优势,文心5.0在架构设计上的创新进一步强化了其性能。依托飞桨深度学习框架,该模型采用超稀疏混合专家架构,总参数量突破2.4万亿,这一庞大的参数规模为模型处理复杂任务提供了充足的算力支撑;同时,其激活参数比例低于3%,这一设计在保证模型强大处理能力的同时,有效降低了推理过程中的资源消耗,大幅提升了实际应用中的效率,让模型在面对大规模视觉数据时既能保持高精度,又能兼顾处理速度。此外,为了进一步提升模型的实用能力,文心5.0还基于大规模工具环境,合成了长程任务轨迹数据。同时,通过基于思维链和行动链的端到端多轮强化学习训练,模型的智能体与工具调用能力得到显著提升,进一步增强了其在实际应用中的适应性。作为目前国内唯一在LMArena视觉理解榜中站稳脚跟的模型,文心5.0 Preview的1206分不仅是一个排名上的突破,更承载着国产大模型在全模态核心技术领域的发展成果。它用实力证明,国产模型已不再局限于中低难度任务,而是具备了在高难度、高价值的视觉理解场景中与国际一线模型竞争的能力,这不仅为国产大模型的技术发展注入了信心,更为后续国产模型在全球大模型竞争格局中提升国际竞争力提供了有力支撑。#百度##Ai##大模型##科技##AI技术##科技先锋官#

49. #DeepSeek新模型有多猛# DeepSeek V3.1发布,6850亿参数量仅激活370亿,计算成本降90%。性能超GPT-4o,中文问答准度89.3%。岚图汽车、江苏银行已应用,未来将突破多模态,推理成本再降50%。#微博声浪计划##听见微博# 凯文思考的微博音频

50. NEO 刚刚证明,每个主要的人工智能实验室建立的视觉模型都是错误的💀OpenAI、谷歌、Anthropic……他们都使用相同的方法:训练视觉编码器,将其固定在 LLM 上,祈祷对齐有效。NEO 说“如果我们只是......不这样做呢?”并从第一原理构建了原生视觉语言模型。这就是为什么这实际上是疯狂的:传统的 VLM 是弗兰肯斯坦架构。你采用预训练的视觉编码器(CLIP,等等)。添加一个投影层。将其附加到冻结的语言模型。希望他们学会互相交谈。它确实有效,但从根本上来说却是碎片化的。视觉和语言竞争模型容量。对齐的成本很高。训练是分阶段进行的。你强迫两个为不同事物设计的系统进行合作。NEO 彻底抛弃了这一点。它通过相同的自回归架构处理图像和文本——一种统一的视觉语言原语,可以从头开始学习这两种模式。无需单独的视觉编码器。无需投影操作。无需对齐税。实现这一目标的技术突破:1)具有混合掩蔽的本机多模态注意力 - 文本标记使用因果注意力(正常的 LLM 行为),图像标记使用完全双向注意力(详尽的视觉交互)。每种模态都在同一模型中同时以其自然的方式处理信息。2)Native-RoPE 为时间、高度和宽度维度分配不同的基本频率——解决文本序列(时间)和视觉数据(空间)之间的关键不匹配问题。不再通过仅限时间的位置嵌入强制空间信息。3)自适应架构在预训练期间使用预缓冲层,然后在微调期间将所有内容合并到整体主干中 - 自动分配编码、对齐和推理的容量。效率?3.9亿个图文示例。不是数十亿。3.9亿。它可以与 GPT-4V 和 LLaVA 相媲美。每个大型实验室都采用模块化架构,因为这是最早奏效的方法。NEO 则表明,我们一直以来都在采用昂贵而复杂的方法。#ai创造营##ai生活指南#

51. #DeepSeek新模型为何被夸爆#如果DS可以把语言模型变成视觉模型,确实会更容易理解。就像人一样,就像如果给咱们一大段长文字,你可能一时间无法捕捉到关键内容,理解起来也会更麻烦。但是如果变成了图像,无疑就会把内容展示的更直观。所以,这样的话,它的理解能力变得更类人,但效率远超过人类。

52. 全球乱跑的"最贵"视频,看我发现了什么…? #商业分析#TCL#出海#全球化

53. DeepSeek-OCR实战(02):DeepSeek-OCR模型介绍

54. DeepSeek正式发布全新多模态模型DeepSeek-OCR

55. DeepSeek开源新成果!把长文档压缩成图片,降低大模型处理成本

56. 为什么说大模型也需要“记忆”管理?如何看待DeepSeek-OCR利用视觉压缩语言来模拟人类遗忘机制?

57. DeepSeek-OCR深度解析:用视觉2D映射颠覆长文本处理

58. 端到端的多模态文档解析模型-DeepSeek-OCR架构、数据、训练方法

59. DeepSeek放出视觉杀招!文本处理从此改朝换代

60. DeepSeek-OCR:突破视觉文本压缩边界的新范式

61. 刚刚,DeepSeek开源新模型:用视觉压缩文本,开启视觉压缩智能时代,再一次领先世界

62. DeepSeek开源新模型:用视觉压缩文本,再一次领先世界,开启视觉压缩智能时代

63. 清华、智谱:用VLM实现LLM百万上下文处理

64. DeepSeek新模型被硅谷疯夸!用二维视觉压缩一维文字,单GPU能跑

65. DeepSeek-OCR模型为何这么火?

66. AI应用|深度解读:DeepSeek新模型为何被夸爆?

67. DeepSeek开源新模型DeepSeek-OCR

68. 文本处理革命来临!DeepSeek再破纪录,全新OCR模型颠覆传统

69. DeepSeek-OCR:把文字“压成图像”的语言模型革命

70. DeepSeek开源DeepSeek-OCR模型:用视觉token实现高效文本压缩,解决长上下文难题!

71. LLM入局,OCR换代:DeepSeek与PaddleOCR-VL等LLM-OCR引领的文档理解新浪潮

72. DeepSeek OCR长文本压缩,记图而不是记文字,颠覆LLM大语言模型

73. Ilya刚预言完,世界首个原生多模态架构NEO就来了:视觉和语言彻底被焊死

74. DeepSeek的新模型很疯狂:整个AI圈都在研究视觉路线,Karpathy不装了

75. 关于DeepSeek下一代大模型架构的推演-压缩能力

76. 复杂部署退退退!DeepSeek-OCR 轻量化文档理解,3分钟私有部署搞定

77. 科技前沿 | DeepSeek刚刚开源新模型,用视觉方式压缩一切

78. DeepSeek 开发的 AI 大模型 / 多模态模型系列介绍以及用途

79. ICCV 2025 (Highlight) Being-VL:师夷长技,用NLP的BPE算法统一视觉语言模型

80. DeepSeek团队开源OCR新模型:少量视觉token完成海量文本压缩

81. DeepSeek又炸场了!全新OCR文档理解模型

82. 太强了!DeepSeek刚刚开源新模型,用视觉方式压缩一切

83. DeepSeek-OCR视觉文本压缩技术解析

84. DeepSeek新模型亮相

85. DeepSeek新模型震撼AI圈:用视觉模型读文档,压缩率高达90%,信息保真97%!

86. 拆解DeepSeek-OCR:3个核心技术让OCR快20倍

87. DeepSeek团队开源视觉语言模型DeepSeek-OCR

88. 多模态:不丢 NLP 能力的视觉语言模型

89. DeepSeek开源新模型!100视觉token干翻7000个,OCR领域迎突破!

90. 视觉压缩革新,大模型长文本处理新范式

91. NTU & SenseTime提出NEO:原生视觉语言模型统一架构,性能媲美模块化VLM

92. VLM 实现 10%的精度提高,13.1倍加速!纽约大学新算法让视觉语言模型更小、更快、更准确

93. NeurIPS 2025 | 把语言模型的推理外挂装进视觉模型

94. LLMOps与智能系统重构,第16章 非结构化数据 ETL:从 OCR 到 VLM

95. DeepSeek视觉语言模型开源:AI开始读懂制造业的图纸与工艺

96. DeepSeek 发布轻量级 OCR 模型:3B 参数、20×视觉压缩,单卡日产 20 万页

97. 让AI懂文档、写出结构化Markdown的OCR模型

98. DeepSeek-OCR模型,用少量视觉token高效提取文本

99. 一文搞懂多模态大模型:视觉-语言模型(VLM)

100. MonkeyOCR v1.5技术报告发布:视觉一致性强化学习,解锁复杂模式下的稳健文档解析

101. 大模型学习必备:一文读懂多模态与文本模型的本质区别(建议收藏)

102. DeepSeek之后,清华和智谱AI提出“视觉压缩”新范式

103. AI笔记19|从单模态到多模态:AI 的多感官进化之路

104. DeepSeek-V3.1震撼发布:混合推理革命引领大模型进入效率时代

105. DeepSeek正式发布全新多模态模型强大升级

106. NeurIPS 2025 | VCM: 让大视觉语言模型像人

107. DeepSeek-VL2:高级多模态理解专家混合VLM

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章