传统RAG依赖向量数据库和文档切块,在处理结构化长文档时易出现溯源不准、幻觉频发等问题。PageIndex提出全新路径:不向量化、不分块,而是构建可推理的层级树索引,让大模型像人类专家一样‘先看目录、再读细节’,显著提升金融财报、法律合同等场景下的精准度与可解释性。
智能速览
摒弃向量数据库与文档切块,采用原生树形索引结构
检索过程由模型主动推理驱动,而非被动相似度匹配
在FinanceBench金融问答基准测试中达到98.7%准确率
适用于有明确章节结构的长文档(如财报、技术手册),但对小说等非结构化文本支持有限
响应速度慢于传统RAG,依赖强推理能力模型,多次迭代增加计算开销
并非替代方案,而是与BM25、图谱等检索方式协同的增强型补充
精华内容
当AI不再被当作信息搬运工,而被赋予‘阅读策略’的自主权,检索就从工程问题回归认知本质——PageIndex正是这一转向的关键实践。
不向量,不分块
PageIndex完全跳过传统RAG中将文档切片、嵌入、存入向量库的三步流程。它直接解析PDF或HTML等原始格式,提取标题层级、段落语义边界与章节摘要,生成一棵嵌套JSON结构的树索引。
这棵树包含节点类型(如’Part I: Financial Summary’)、子节点引用、内容摘要及页码范围,全部保留在模型上下文窗口内。
实测显示,一份217页的上市公司年报可压缩为约3200 token的树索引,体积仅为原始文本的4.2%,却完整保留逻辑骨架。
模型自主推理检索
检索启动后,模型基于用户问题生成推理链:先定位最相关父节点(如’Consolidated Statements of Income’),再逐层向下筛选子节点,最终加载具体段落参与生成。
在FinanceBench测试中,该机制使答案溯源准确率提升至98.7%,较传统RAG平均高出13.5个百分点;错误回答中82%源于向量召回偏差,而PageIndex仅1.1%因节点误判导致。
对比Claude Code的文件导航逻辑,PageIndex将同一范式扩展至非代码类长文档,验证了‘工具+目录+推理’范式的普适潜力。
结构依赖与适用边界
PageIndex在财报、专利说明书、ISO标准文档等具备清晰标题体系的文本上表现最优,章节命中率达94.3%。
但对无章节标记的小说、会议纪要或扫描版OCR错乱文档,树构建失败率超67%,此时需前置人工标注或融合BM25做初筛。
网友实测发现:查询‘A公司2023年门店数量及毛利率’可在经营分析章节3秒定位;而问‘主角A送B什么生日礼物’这类跨事件隐含关系问题,因缺乏时间轴索引,召回延迟达12秒且准确率不足31%。
成本与性能权衡
单次问答平均触发2.8轮节点推理,GPT-4-turbo下端到端延迟为3.2秒,比传统RAG慢1.7秒;若使用Qwen2-7B本地部署,延迟升至8.9秒,且首节点误判率上升至24%。
算力消耗方面,同等文档规模下,PageIndex推理token用量比传统RAG高41%,但向量存储开销降为零。
这意味着:它更适合对结果可信度要求严苛、且能接受响应延时的B端专业场景,而非C端即时问答。
PageIndex没有终结RAG,而是重新定义了‘检索’的内涵——从匹配走向理解,从外部依赖走向内部推理。它揭示了一个趋势:当模型能力持续增强,检索架构终将向认知对齐演进。未来更值得探讨的是,如何让树索引自适应非结构化内容,以及多检索路径(向量+树+关键词)如何动态协同?这或许才是下一代RAG真正的破局点。
关键评论
在按‘类型’组织或每章有明确主题的结构化文档上效果应不错,比如财报里的经营情况部分很容易找到;但小说这类按时间或事件组织的内容,PageIndex难以快速定位情节和人物关系。
人类已对标题和内容建立抽象关联,并构建了这种层级关系,分层检索理所当然。商品图谱不知是否有类似思路。
感觉很像GraphRAG,都是利用结构化关系提升检索质量。
关键在于构建有效的层级树,不仅能提升效果还能提高检索效率。