普通人用RAG别再堆技术了:混合检索才是又快又稳的最优解

源自97位全网作者

04-12 10:42

内容由AI生成

精选参考来源

1. RAG(检索增强生成)会不会消亡呢?

2. 深度解析RAG、LangChain、Agent三者间的关系(附应用案例+大厂内部资源合集)

3. 《REFRAG: Rethinking RAG based Decoding》Meta最新发布的REFRAG技术,彻底解决了检索增强生成模型(RAG)最大的瓶颈:解码效率低下。相比传统RAG,REFRAG实现了30倍更快的首词生成速度,同时保持零准确率损失。问题核心在于:RAG在输入大量检索段落时,实际只有5-10段内容对生成有用,剩余多数成为计算负担,但模型仍对所有段落进行全面注意力计算,导致时间和内存资源巨大浪费。传统RAG用16K上下文时,首次输出延迟超过100秒,吞吐量下降10倍,内存消耗爆表。REFRAG通过将上下文块压缩成单一嵌入向量,避免了对全部16,384个token的逐一处理,仅需处理约1,024个压缩块嵌入,极大减少计算量。成果显著:- 首词生成速度提升30.85倍- 语义困惑度(perplexity)无损失- 上下文容量扩展16倍(4K token → 64K token)- 性能超越前沿技术3.75倍为何行得通?因为RAG的注意力模式稀疏,大多数检索段落间无交互。REFRAG通过以下三点巧妙利用这一点:1. 预计算并缓存嵌入,推理时重复使用2. 基于强化学习的压缩策略,智能决定哪些块需展开3. 不受位置限制,任意位置均可压缩实际应用优势:- 仅8段文本的延迟即可达到单段处理速度- 在检索器性能较弱时,依然提升准确率- 可支持无限长会话历史- 无需修改基础模型架构这项技术改变了RAG的计算经济学:更多上下文、更低延迟,且成本更优。REFRAG不仅是性能优化,更是RAG从“功能”向“基础设施”转型的关键一步。它告诉我们,提升AI系统效率的关键不在于盲目增加计算资源,而是精准减少无效计算,压缩信息冗余,从根本上优化流程。更多细节和论文链接见:arxiv.org/abs/2509.01092这背后,技术创新带来的不仅是速度,更是未来大规模长文本理解与生成的基石。希望更多开发者和研究者能从中得到启发,推动RAG技术应用迈入新阶段。

4. 请教一下各位关于RAG(检索增强生成)的几个问题?

5. 在构建RAG Agent时,哪些场景应该用确定性逻辑判断取代LLM的概率推理,具体怎么实现?

6. Perplexity 如何打造 AI 搜索

7. 超越传统 RAG:知识图谱如何增强 AI 的记忆与推理能力

8. 关于 NotebookLM 植入 Gemini 这件事,我详细写了一篇自己的使用体验:网页链接NotebookLM 里的笔记本可以作为 Gemini 的外挂 RAG,Gemini 的答案会更加精准,幻觉会收敛,输出更加聚焦和有价值。而对于 NotebookLM 来说,Gemini 帮它搞定了多笔记本互通的事情,另外,NotebookLM 干不了的事儿,Gemini 可以代劳,比如 Deep Research,出图,做视频,写程序等等。这就有点像 Agentic RAG,当然,因为 Gemini 是面向所有互联网数据的,泛化的更厉害一些。目前墨问时间的知识库,还是经典 RAG,要升级成 Agentic RAG,本质是让模型从“只在生成参与”扩展到“全链路参与”,把检索变成一个可决策、可路由、可自我评估的系统,并引入可持久记忆与多源工具。这样不仅提升准确性与覆盖率,也能在复杂查询下保持稳健。还有很长的路要走……

9. Leonie Monigatti深入剖析了AI代理中的记忆演进,从最初的RAG(检索增强生成)到Agentic RAG,再到具备读写能力的Agent Memory,厘清了这一系列技术的核心逻辑与突破。RAG诞生于2020年,其核心是将离线存储的外部知识检索进LLM上下文,解决模型记忆有限带来的问题。但其“单次检索”与“只读”限制导致复杂场景下仍有误导风险。Agentic RAG引入了“工具调用”机制,允许智能体主动判断是否需要检索、选择检索工具,并评估检索结果相关性,显著提升了灵活性和准确性,但仍无法动态学习和更新信息。Agent Memory则迈出关键一步:支持智能体不仅读取,还能写入和管理外部记忆,实现基于历史交互的持续学习和个性化体验。它将记忆从“静态”转变为“动态”,但也带来了记忆管理和遗忘机制的新挑战。这三者共同体现了信息“存储-检索-编辑-删除”的完整闭环,也反映了AI系统从单点知识调用向复杂记忆体系演进的趋势。未来,如何设计高效的多源、多类型记忆管理策略,将是提升AI智能和人机交互体验的关键。详细内容及代码示例请见原文:leoniemonigatti.com/blog/from-rag-to-agent-memory.html

10. 【保姆级】RAG智能体终极方案:n8n+Google File Search,零门槛搭建高精度RAG工作流!

11. RAG退潮,“文件系统+grep”回归,智能体检索的返璞归真

12. 通俗易懂的解释 LLM,RAG 和 AI Agent 的差别,以下内容为原推的翻译:我终于明白了LLM、RAG和AI智能体的区别过去两年里,我一直在搭建真正落地的AI系统。现在,我终于清楚了:LLM(大语言模型)、RAG(检索增强生成)和AI智能体(AI Agents),根本不是互相竞争的技术,而是构成同一个AI智能系统的三个层次。很多人用错了方法,把它们当成互斥的工具。---> 大语言模型是“大脑” <LLM 就像AI的脑子,它会思考,会写作,也懂语言。但问题来了:它是冻结在某个时间点的。比如 GPT-4,它的知识截止到训练结束的那一天。你问它昨天的新闻发生了什么?那可就瞎编了。大语言模型很聪明,但却不了解“现在”正在发生的事。---> RAG是AI的“记忆” <这时候就需要 RAG(Retrieval-Augmented Generation,检索增强生成)了,它相当于给大脑接入了“外置内存”。当你提问时,RAG会先去外部数据库或文档里搜索,把相关资料抓出来,再丢给大语言模型作为上下文。这样一来,原本静态的模型一下子就“活”了:- 有最新的数据- 有真实的事实- 完全不需要重新训练模型最关键的是,准确率立刻就提高了。大语言模型不用再靠记忆乱猜,而是真正地在实时检索到的信息上进行推理。你甚至还能追溯每个答案到底用了哪些文档。---## > AI智能体是AI的“行动力” <尽管LLM能思考,RAG能提供新鲜的数据,但它们都缺乏真正的行动能力。这时,AI智能体(AI Agents)出场了。它在大语言模型的外面套上了一个控制循环:- 设定目标- 规划步骤- 执行行动- 回顾反思AI智能体并不仅仅是回答问题那么简单,它能自主地去研究一个话题、收集数据、撰写报告,甚至帮你发邮件,全程自动化。---> 真正的生产级AI,要同时用好这三者 <很多酷炫的AI展示,其实只是单纯用了LLM再配上花里胡哨的提示词。但真正能落地的AI系统,往往同时结合了这三个要素:- LLM 提供推理和思考能力- RAG 确保知识准确而新鲜- AI智能体 则提供行动和决策能力---> 如何选用这三者? <- 只用LLM 如果你需要纯语言的任务,比如写作、摘要、解释。- LLM + RAG 如果你需要回答涉及特定文档、技术手册、专业领域知识的问题,并确保答案准确无误。- LLM + RAG + AI 智能体 如果你需要真正的自主行动,比如系统自己决策、执行任务、管理复杂流程。---> AI的未来,不是选哪一种,而是如何把这三层架构起来 <记住这个公式:- LLM负责思考- RAG负责知识- AI智能体负责行动真正的AI智能系统,就是这三者协同起来,形成一个完整的智能架构。来源:x.com/connordavis_ai/status/1985663551697273216

13. 如何系统性的学习RAG、Agent、MCP?

14. Obsidian 搭配什么AI工具 ?Codex篇 保姆上手教程 ClaudeCode 对比

15. 《扣子开发 AI Agent 智能体应用》014-基于大模型的企业知识库(知识库的理论基础 RAG)

16. 基于 Ray 的蚂蚁数据构建引擎在搜推、RAG 场景的实践

17. 用我们自家的AI,普通人也能享用优秀分析师的服务#AI #Reportify #商业研究 #智能体

18. Boris(Claude Code 创始人)解释为什么 Claude Code 不用 RAG 向量检索代码:在开发 Claude Code 的早期版本时,我们曾尝试过 RAG 搭配本地向量数据库的方案。但很快我们就发现,Agent 使用关键字搜索在实际应用中的表现通常要出色得多。这种方案不仅实现起来更加简洁,而且还完美避开了 RAG 模式下那些令人头疼的“老毛病”:比如数据安全性、隐私泄露风险、信息滞后以及系统可靠性等问题。

19. Milvus 向量数据库实战:从零构建高性能 RAG 系统

20. 为什么 RAG 落地难?解析数据处理 “三重困境”,事件驱动架构如何破局?

21. 做了个RAG评估小框架开源做RAG时发现,麻烦的往往是数据处理到评估的那条流水线。所以顺手写了个工具,用中文数据集做基准,内置标准流程,方便快速试不同的检索和生成方案平时主要用它两件事,一是快速验证新想法,不用重复写脚本,二是在同一套指标下对比不同策略,看问题出在哪#rag#

22. RAG的主流类型 第二期

23. 大模型RAG技术全解析

24. 为什么我不再相信RAG?实战RAG弊端揭秘

25. PageIndex 能替代传统RAG吗?

26. 别再只会写普通RAG了!试试Agentic RAG

27. 2026年构建RAG系统的核心策略

28. RAG实战(第一部分)

29. 第五章

30. RAG 入门指南

31. RAG的老酒,装在Mintlity的新瓶ChromaFs获得了460倍性能提升

32. 如何选择AI知识库架构?深度解析RAG、GraphRAG与微调方案

33. 别再瞎调 chunk_size 了!我从零搭建 RAG 学到的 10 条经验

34. 大模型RAG技术,从入门到精通,一文彻底搞懂RAG

35. 大模型入门第十一课

36. RAG小白入门指南

37. 产品经理视角的RAG技术入门指南

38. RAG检索增强生成

39. RAG 完全指南

40. RAG入门

41. RAG 避坑指南

42. RAG文档处理策略

43. 在RAG文档处理中——表格数据的处理思路

44. 从知识增强到微调

45. 范式革新!A-RAG如何让大模型自主掌控检索,突破传统RAG瓶颈?

46. LLM中的向量RAG与Graph RAG

47. AI应用开发

48. 花两天拆了 Dify RAG 源码,跟自己写的 RAG 对比后,我才知道差距在哪

49. 大厂都在用的 RAG 架构,我踩过的坑都在这儿了

50. 从检索到生成,RAG效果评估全链路拆解,面试应答这样说才加分

51. 大模型检索增强生成(RAG)实战

52. AI工具怎么搭配更划算

53. 不用RAG, AI永远不可靠

54. RAG

55. RAG的多路召回是如何实现的?

56. AI产品经理一图流

57. 人话版AI词典 | 第9期

58. OpenClaw私有RAG实战

59. RAG

60. RAG小助手,让AI记住你的秘密文件

61. 一篇搞明白!MCP、RAG、Agent

62. 从RAG到Agentic RAG 的进化之路

63. 收藏!一文读懂RAG技术选型:从入门到企业级实践全攻略

64. 简单RAG系统!n8n + 谷歌造出企业级知识库

65. 本地化部署大模型-RAG 叠加

66. 面试常问的RAG文本向量检索不准怎么办?

67. Claude Code 外接知识库终极指南:50+ RAG 工具全景对比 | MCP · 多模态 · 选型指南

68. 告别“傻叉“被动式RAG!主动式RAG让AI像人类一样思考,效率提升10倍!

69. 一个实习生,用三天时间搭出了一个"公司知识问答机器人"

70. RAG资料包上线: 让你的AI不再“胡说八道”——从入门认知到实战落地,AI开发者的第一堂课

71. AI面试常挂题!"评估RAG效果"新手盯指标,老鸟却栽在产品视角上

72. 蚂蚁面试官追问:"你的 RAG 系统首字响应要

73. RAG 系统优化实战:从 2 秒到 200ms 的 9 个关键优化点

74. 全网最实用免费AI学习地图(5)告别AI幻觉,打造专属个人知识库

75. RAG高级调优指南:三大方向提升检索效率

76. 9个RAG调优方法——高级RAG

77. 你现在用到第几种 RAG 了?

78. 6.1K Star!AI工程师必收藏!22种RAG技术全实现,从入门到王者的开源宝典!

79. 在RAG架构中,如何为你的AI Agent选择最佳“长时记忆”

80. 动手实现RAG

81. 面试高频题:RAG 为何越用越慢?性能调优策略全解析

82. 如何量化评估RAG系统效果

83. RAG调优实战(一)精准锁定,2个优化让准确率3倍提升

84. 艾体宝干货 | RAG技术对比:向量数据库和ArangoDB知识图谱GraphRAG

85. RAG应用性能优化入门指南 检索增强生成(RAG)通过向量检索与大语言模型结合,使AI能运用私有数据构建知识问答等应用。其核心流程分为数据索引(分块、向量化)与查询(检索、合成)两阶段。但朴素RAG常面临检索质量不佳(低精确率/召回率)和大模型幻觉两大核心挑战,限制了实际效果。 建立评估体系是优化的基石,需从两个维度入手:检索器评估(衡量文本块相关性,使用命中率、NDCG等指标)和端到端评估(衡量最终答案质量)。评估数据集可通过人工标注、用户反馈或强模型合成生成,为持续迭代提供衡量标尺。 基础优化技术投入小见效快:调整文本块大小是最关键一步,过长上下文会导致"中间丢失"现象。应通过实验找到平衡检索精度与上下文质量的最佳尺寸。添加元数据过滤(如年份、标题)可在语义搜索基础上实现精准定位,如同SQL的WHERE子句,大幅提升精确率。 进阶策略巧妙平衡精度与上下文:"小块到大块检索"解耦检索与合成单元——索引细粒度小块提升精度,合成时扩展为大块保证上下文完整。优化嵌入内容(如使用摘要或预生成的假设性问题而非原文)能进一步提升检索精准度,同时保留完整文本供生成使用。 前沿技术释放RAG全部潜力:多文档智能体将文档视为可调用的工具集(如总结、问答),能自主规划多步骤完成跨文档综合分析。模型微调分为两类:检索微调(优化嵌入模型理解领域术语)和合成微调(通过知识蒸馏让弱模型学习强模型能力)。 优化应循序渐进:基础技术解决噪音与遗漏,进阶策略平衡精度与上下文,前沿探索实现复杂推理。牢记所有优化始于可靠评估体系,需根据具体场景持续迭代,方能构建真正高性能的RAG应用。 #RAG #优化

86. 利用AI Agent搭建RAG系统

87. 构建AI智能体:二十三、RAG超越语义搜索:如何用Rerank模型实现检索精度的大幅提升

88. 学 RAG 找工具找到头秃的日子终于结束😭

89. 从80%到90%:一个开发者亲历的RAG系统优化之路

90. 7.5K Star!开源AI笔记神器Blinko,卡片式速记+RAG检索,隐私优先的灵感捕手

91. 蒙帕视角丨什么是 Naive RAG?— RAG 架构演进之路的起点

92. 大模型RAG

93. AI基础 | 融合知识图谱的检索增强生成(RAG)

94. 智能检索工具Perplexity

95. 137期工具精选:9大类别全覆盖,从下载加速到RAG框架的实用工具盛宴

96. 08|工具篇:让模型学会“查资料”——RAG与Toolformer的实践

97. CER:证据对比Re-Ranking低成本为RAG添加可解释性

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章