传统RAG系统仅能处理文本,面对财报、论文中的图表信息往往无能为力。香港大学提出的RAGAnything框架,通过构建统一的多模态知识图谱,有效解决了异构文档检索中的信息损失问题。
智能速览
解决传统RAG无法利用图表、公式等非文本信息的痛点
提出双图构建架构,融合跨模态图谱与纯文本图谱
采用跨模态混合检索,结合结构导航与语义匹配
实验显示在长文档场景下准确率显著优于现有模型
精华内容
针对真实文档中图文并茂的特性,该框架将多模态内容视为互联的知识实体网络,重构了检索逻辑。
突破文本局限
现有的检索增强生成(RAG)技术大多聚焦于纯文本数据,但在实际应用中,财报、科研论文等高价值知识库往往包含大量表格、图表和数学公式。传统方法若直接丢弃这些非文本信息,或进行粗糙的文本转化,都会导致严重的信息损失。这正是当前RAG技术面临的核心痛点,即系统能力与真实信息环境之间存在关键错位。
双图构建机制
为解决这一问题,新框架引入了双图构建策略。首先是通用知识表示,将文档精准拆解为图、文、表、公式等原子知识单元。随后分别构建跨模态知识图谱和基于文本的知识图谱。前者为非文本内容提供上下文基础,后者挖掘文文语义,最后通过实体对齐将两者缝合,形成单一连贯的知识网络。
混合检索策略
在检索环节,系统不再单一依赖语义相似度,而是实施了跨模态混合检索。这种方法同时从结构和语义两个维度进行搜索,兼顾了结构化知识的强关联性与语义层面的高相关性。通过这种“结构导航+语义匹配”的双管齐下,实现了对复杂文档中证据的精准且全面的查找。
长文档实测
实验数据表明,RAGAnything在DocBench和MMLongBench等基准测试中表现优异。特别是在处理长文档时优势尤为突出,当文档页数超过100页时,其准确率比次优模型高出13%。随着文档长度增加、信息分散度提高,该框架构建的知识图谱展现出了卓越的推理能力和稳定性。
RAGAnything不仅为多模态RAG领域提供了全新的统一范式,更通过开源为社区贡献了强大基座。这一突破让我们看到,大模型在处理复杂长文档时的潜力正在被逐步释放。