张大妈

DeepSeek 又改了”常识”:这次他们教 AI 像人一样”看书”

源自今日头条:人人都是产品经理

02-18 10:44

DeepSeek最新研究挑战了OCR领域十年的CLIP架构,提出“视觉因果流”机制。该技术让AI学会像人类一样按语义跳跃阅读,显著提升了复杂文档的理解准确率与效率,为通向原生多模态AI指明了新方向。

DeepSeek 又改了”常识”:这次他们教 AI 像人一样”看书”智能速览

  • DeepSeek-OCR 2挑战了统治OCR领域十年的CLIP架构。

  • 新技术通过“视觉因果流”让AI学会像人一样按语义跳跃阅读。

  • 其核心是用轻量级LLM替换CLIP编码器,引入因果推理能力。

  • 实测阅读顺序准确率提升33%,文档理解重复率显著下降。

  • 该架构为未来统一处理图像、音频和文本的原生多模态模型铺路。

DeepSeek 又改了”常识”:这次他们教 AI 像人一样”看书”精华内容

长期以来,AI阅读文档的方式与人类迥异,导致在处理复杂布局时效率低下。DeepSeek的新研究正是要颠覆这一根本逻辑。

CLIP的十年困局

过去十年,CLIP架构主导着视觉语言模型,其核心假设是图像按从左上到右下的固定顺序处理。这一假设在处理简单图像时够用,但面对复杂文档则彻底失效。

以表格为例,人类会先看表头,再按逻辑读取数据行。而CLIP则按物理位置顺序扫描,可能读完第一行的第五列,就跳到第二行的第一列,完全打乱了语义逻辑。这种用线性序列表达二维逻辑的方式,在处理公式、多栏布局和图表引用时效率极低,是AI文档理解的根本瓶颈。

因果流的解法

DeepSeek的方案是彻底弃用CLIP编码器,改用轻量级LLM(Qwen2-0.5B),并设计了“双流注意力”机制。视觉Token通过双向注意力进行全局感知,相当于先“扫一眼”了解文档概貌。

随后,引入“因果流查询”Token,它们可以关注所有视觉Token,但只能按顺序关注之前的查询。这模拟了人类的阅读决策过程:“看完标题,该读摘要了”、“图表更重要,先看图表”。最终,这些查询Token会为视觉Token排定一个符合语义的阅读顺序,再交由解码器生成文本。

性能大幅跃升

在严格的OmniDocBench v1.5基准测试中,DeepSeek-OCR 2取得了91.09%的整体得分。更具说服力的是“阅读顺序”指标,编辑距离从0.085降至0.057,意味着AI的阅读逻辑更接近人类,准确率提升了33%。

生产环境数据同样印证了这一点。在线日志图像的重复率从6.25%降至4.17%,PDF批处理重复率从3.69%降至2.88%。重复内容减少,直接说明AI的“瞎猜”行为变少,阅读逻辑更为精准。

通向统一多模态

这项技术的意义超越了OCR本身。DeepSeek指出,其DeepEncoder V2架构的核心是“因果推理能力”,而非单纯的视觉特征提取。这一逻辑是普适的:图像需要按语义顺序阅读,音频需要按时间顺序理解,文本本身就需要因果注意力。

未来,同一编码器或可统一处理图像、音频、文本等多种模态,共享底层的因果推理能力,这可能是通向真正原生多模态大模型的一条关键路径。

DeepSeek-OCR 2不仅是一次技术升级,更是对AI认知方式的深刻反思。通过教会机器按语义逻辑阅读,它为解决复杂文档理解难题提供了新范式。这是否预示着,未来的AI将拥有更接近人类的、真正高效的“常识”与洞察力?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章