RAG技术是当前大模型应用领域的核心考点。这篇内容深入剖析了为何选择RAG而非微调,并系统梳理了从检索技术到工程实践,再到评估优化的完整链路,帮助建立结构化认知,轻松应对面试中的深度提问。
智能速览
RAG通过外挂知识库解决模型幻觉,成本远低于微调。
混合检索结合语义与字面匹配,是生产环境的主流方案。
选择向量库需考量QPS、延迟和运维成本,不同阶段选型不同。
合理的切分策略与Overlap设计是保证语义完整性的关键。
使用RAGAS等框架量化评估召回率、精准度和忠实度。
精华内容
RAG为何成为大模型应用的热门技术?深入其核心,会发现它在成本、效果和可维护性上有着独特的优势。
RAG的价值选择
面对企业私有或最新知识,大模型本身存在“幻觉”风险。微调方案不仅训练成本高昂,知识更新还需重新训练,且对事实记忆的稳定性不足。相比之下,RAG为模型外挂了可实时更新的知识库,如同开卷考试,能有效引用溯源、降低幻觉,且维护成本极低,知识更新灵活,这使其成为事实类问答场景的更优选择。
检索的技术内核
单纯的全文检索(如BM25)依赖字面匹配,在面对“断电”与“掉电”等同义词时容易召回失败。因此,生产环境普遍采用混合检索策略,即融合向量语义检索与BM25字面检索,再通过Rerank模型进行结果重排,兼顾了语义理解与精准匹配。
向量库的选型也需因地制宜。在概念验证(POC)阶段,Chroma、FAISS等本地轻量库足够使用;但在生产环境中,则需考虑Milvus、Qdrant或Elasticsearch 8.x这类具备更高QPS、更低延迟和完备元数据过滤能力的方案。
工程实践的关键
Embedding模型的维度是成本与效果的关键权衡点。低维度向量区分度差,而高维度则带来更高的存储与检索开销。部分模型支持通过“截断向量”来平衡速度与成本。
在文档切分上,800-1000个tokens是常见的Chunk Size范围。块太小会导致语义割裂,太大则引入过多噪音并可能出现“信息淹没在中间”的问题。为防止逻辑被切断,通常会设置10%-20%的Overlap,并采用递归策略,按段落、行、句、逗号等顺序逐级切分。
评估与优化路径
RAG系统的优化离不开量化评估。通过RAGAS或TruLens等框架,可以关注三个核心指标:Context Recall(上下文召回率,判断知识是否找全)、Context Precision(上下文精准率,判断噪音多少)和Faithfulness(忠实度,判断回答是否完全来源于上下文)。
针对不同指标,优化路径也不同。召回率低,可引入混合检索或查询重写;精准率低,则需增加Reranker和过滤策略;若生成效果不佳,Parent-Child分块策略是有效的解决方案。
理解RAG不仅要掌握其原理,更要清楚其在不同场景下的技术选型与评估优化逻辑。它不是一个孤立的技术,而是一套围绕“检索增强”构建的完整工程体系。随着AI应用的深化,掌握RAG将成为大模型时代的核心技能之一。