张大妈

一文读懂AI Search:从RAG到DeepSearch

源自公众号:dbaplus社群

01-31 11:27

大语言模型的知识存在时效性与范围局限,检索增强生成(RAG)技术应运而生。它通过引入外部知识,让模型回答更精准。如今,RAG已从固定流程进化为具备自主规划能力的智能体,如DeepSearch,这标志着AI正从被动工具向主动探索者转变,为解决复杂问题提供了全新思路。

一文读懂AI Search:从RAG到DeepSearch智能速览

  • 大模型知识受限于训练数据的时效性和覆盖范围。

  • RAG技术通过检索外部信息来弥补模型知识的不足。

  • AI搜索经历了从固定流程到智能体自主决策的演化。

  • 智能体发展面临知识边界与能力边界的双重挑战。

  • 信息与工具是突破模型能力边界的关键。

  • DeepSearch是当前Agentic RAG的主流实现形式。

一文读懂AI Search:从RAG到DeepSearch精华内容

检索增强生成(RAG)技术的演进,本质上是从死板的人工工程走向灵活的模型自主性。这趟旅程不仅改变了信息与模型交互的方式,更重塑了对AI智能体的能力边界和发展路径的认知。

模型的知识困境

大语言模型的知识源于训练数据,但这带来了两个核心局限。首先是时效性问题,训练数据总有截止日期,模型无法获取新知识。其次是范围问题,模型难以接触到企业内部的私域数据。这些“长尾信息”的缺失,使得模型在处理特定或最新问题时表现不佳,这本质上是机器学习领域一直存在的超出分布(OOD)问题,即模型在面对未见过的数据分布时,泛化能力会下降。

RAG的破局之道

为解决知识局限,检索增强生成(RAG)技术提供了在推理阶段注入知识的方法。它将用户问题与检索到的相关知识一并输入模型,利用其上下文学习能力生成更准确的回答。相比重新训练模型,RAG成本更低、灵活性更高,能快速响应具体问题,成为连接模型动态知识库的关键桥梁。

技术演化的三阶段

RAG的发展经历了清晰的演进路径。第一阶段是简单的“检索-生成”固定流程。第二阶段开始优化,一方面通过改写、扩展等方法优化用户查询,另一方面升级检索技术,从文本检索到混合检索乃至使用模型进行重排。第三阶段则随着推理模型的出现,进化为Agentic RAG,模型能自主判断检索需求与策略,实现多轮循环搜索。

智能体的双重边界

Agentic RAG的自主性面临两个边界条件的挑战。知识边界指模型需要判断自身内在知识是否足够回答问题,并主动填补认知差距。能力边界则指模型需识别自身能力的短板,如不擅长数值计算时,主动调用计算器或代码解释器等工具。二者相辅相成,信息(知识)是基础,工具(能力)是拓展,共同构成智能体与外界交互的核心。

DeepSearch的实现

DeepSearch是Agentic RAG的典型实现。其核心是推理模型,它负责深度思考,判断当前信息是否充足,并自主生成下一步的检索问题。这个框架与之前的ReAct一脉相承,但因推理模型而更加强大。AI Search作为DeepSearch的核心,是许多垂直应用(如编程、浏览器智能体)的基础,相当于AI的“阅读”能力,为后续的“创作”提供信息支持。

走向通用智能体

从长远看,模型内在知识的局限性将持续存在,检索增强的需求也将持续。AI Search的设计范式从人工工程转向模型自主,符合“苦涩的教训”所揭示的规律。为更好地解决知识边界和能力边界问题,模型训练正从有监督微调(SFT)转向强化学习(RL),旨在授予智能体“渔”而非“鱼”,使其能在动态环境中自主学习和成长,最终演化为运用多样化工具的通用智能体。

从朴素的RAG到自主的DeepSearch,AI搜索的进化史是模型能力不断突破边界的缩影。它标志着AI正从信息搬运工向主动的研究者与问题解决者转变。随着强化学习等技术深化,未来的智能体将不再局限于阅读,而是能灵活运用各类工具,一个更加通用的智能时代或许已不远。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章