普通人用RAG别再堆技术了:混合检索才是又快又稳的最优解
04-12 10:42
精选参考来源
精选参考来源
1. RAG(检索增强生成)会不会消亡呢?
知乎 2026-01-01 00:00:00
2. 深度解析RAG、LangChain、Agent三者间的关系(附应用案例+大厂内部资源合集)
知乎 2025-12-04 00:00:00
3. 《REFRAG: Rethinking RAG based Decoding》Meta最新发布的REFRAG技术,彻底解决了检索增强生成模型(RAG)最大的瓶颈:解码效率低下。相比传统RAG,REFRAG实现了30倍更快的首词生成速度,同时保持零准确率损失。问题核心在于:RAG在输入大量检索段落时,实际只有5-10段内容对生成有用,剩余多数成为计算负担,但模型仍对所有段落进行全面注意力计算,导致时间和内存资源巨大浪费。传统RAG用16K上下文时,首次输出延迟超过100秒,吞吐量下降10倍,内存消耗爆表。REFRAG通过将上下文块压缩成单一嵌入向量,避免了对全部16,384个token的逐一处理,仅需处理约1,024个压缩块嵌入,极大减少计算量。成果显著:- 首词生成速度提升30.85倍- 语义困惑度(perplexity)无损失- 上下文容量扩展16倍(4K token → 64K token)- 性能超越前沿技术3.75倍为何行得通?因为RAG的注意力模式稀疏,大多数检索段落间无交互。REFRAG通过以下三点巧妙利用这一点:1. 预计算并缓存嵌入,推理时重复使用2. 基于强化学习的压缩策略,智能决定哪些块需展开3. 不受位置限制,任意位置均可压缩实际应用优势:- 仅8段文本的延迟即可达到单段处理速度- 在检索器性能较弱时,依然提升准确率- 可支持无限长会话历史- 无需修改基础模型架构这项技术改变了RAG的计算经济学:更多上下文、更低延迟,且成本更优。REFRAG不仅是性能优化,更是RAG从“功能”向“基础设施”转型的关键一步。它告诉我们,提升AI系统效率的关键不在于盲目增加计算资源,而是精准减少无效计算,压缩信息冗余,从根本上优化流程。更多细节和论文链接见:arxiv.org/abs/2509.01092这背后,技术创新带来的不仅是速度,更是未来大规模长文本理解与生成的基石。希望更多开发者和研究者能从中得到启发,推动RAG技术应用迈入新阶段。
新浪微博 2025-12-12 00:00:00
4. 请教一下各位关于RAG(检索增强生成)的几个问题?
知乎 2025-10-19 00:00:00
5. 在构建RAG Agent时,哪些场景应该用确定性逻辑判断取代LLM的概率推理,具体怎么实现?
知乎 2025-12-11 00:00:00
6. Perplexity 如何打造 AI 搜索
知乎 2025-11-04 00:00:00
7. 超越传统 RAG:知识图谱如何增强 AI 的记忆与推理能力
知乎 2025-11-28 00:00:00
8. 关于 NotebookLM 植入 Gemini 这件事,我详细写了一篇自己的使用体验:网页链接NotebookLM 里的笔记本可以作为 Gemini 的外挂 RAG,Gemini 的答案会更加精准,幻觉会收敛,输出更加聚焦和有价值。而对于 NotebookLM 来说,Gemini 帮它搞定了多笔记本互通的事情,另外,NotebookLM 干不了的事儿,Gemini 可以代劳,比如 Deep Research,出图,做视频,写程序等等。这就有点像 Agentic RAG,当然,因为 Gemini 是面向所有互联网数据的,泛化的更厉害一些。目前墨问时间的知识库,还是经典 RAG,要升级成 Agentic RAG,本质是让模型从“只在生成参与”扩展到“全链路参与”,把检索变成一个可决策、可路由、可自我评估的系统,并引入可持久记忆与多源工具。这样不仅提升准确性与覆盖率,也能在复杂查询下保持稳健。还有很长的路要走……
新浪微博 2025-12-23 00:00:00
9. Leonie Monigatti深入剖析了AI代理中的记忆演进,从最初的RAG(检索增强生成)到Agentic RAG,再到具备读写能力的Agent Memory,厘清了这一系列技术的核心逻辑与突破。RAG诞生于2020年,其核心是将离线存储的外部知识检索进LLM上下文,解决模型记忆有限带来的问题。但其“单次检索”与“只读”限制导致复杂场景下仍有误导风险。Agentic RAG引入了“工具调用”机制,允许智能体主动判断是否需要检索、选择检索工具,并评估检索结果相关性,显著提升了灵活性和准确性,但仍无法动态学习和更新信息。Agent Memory则迈出关键一步:支持智能体不仅读取,还能写入和管理外部记忆,实现基于历史交互的持续学习和个性化体验。它将记忆从“静态”转变为“动态”,但也带来了记忆管理和遗忘机制的新挑战。这三者共同体现了信息“存储-检索-编辑-删除”的完整闭环,也反映了AI系统从单点知识调用向复杂记忆体系演进的趋势。未来,如何设计高效的多源、多类型记忆管理策略,将是提升AI智能和人机交互体验的关键。详细内容及代码示例请见原文:leoniemonigatti.com/blog/from-rag-to-agent-memory.html
新浪微博 2025-11-04 00:00:00
10. 【保姆级】RAG智能体终极方案:n8n+Google File Search,零门槛搭建高精度RAG工作流!
哔哩哔哩 2025-12-04 00:00:00
11. RAG退潮,“文件系统+grep”回归,智能体检索的返璞归真
知乎 2026-04-04 00:00:00
12. 通俗易懂的解释 LLM,RAG 和 AI Agent 的差别,以下内容为原推的翻译:我终于明白了LLM、RAG和AI智能体的区别过去两年里,我一直在搭建真正落地的AI系统。现在,我终于清楚了:LLM(大语言模型)、RAG(检索增强生成)和AI智能体(AI Agents),根本不是互相竞争的技术,而是构成同一个AI智能系统的三个层次。很多人用错了方法,把它们当成互斥的工具。---> 大语言模型是“大脑” <LLM 就像AI的脑子,它会思考,会写作,也懂语言。但问题来了:它是冻结在某个时间点的。比如 GPT-4,它的知识截止到训练结束的那一天。你问它昨天的新闻发生了什么?那可就瞎编了。大语言模型很聪明,但却不了解“现在”正在发生的事。---> RAG是AI的“记忆” <这时候就需要 RAG(Retrieval-Augmented Generation,检索增强生成)了,它相当于给大脑接入了“外置内存”。当你提问时,RAG会先去外部数据库或文档里搜索,把相关资料抓出来,再丢给大语言模型作为上下文。这样一来,原本静态的模型一下子就“活”了:- 有最新的数据- 有真实的事实- 完全不需要重新训练模型最关键的是,准确率立刻就提高了。大语言模型不用再靠记忆乱猜,而是真正地在实时检索到的信息上进行推理。你甚至还能追溯每个答案到底用了哪些文档。---## > AI智能体是AI的“行动力” <尽管LLM能思考,RAG能提供新鲜的数据,但它们都缺乏真正的行动能力。这时,AI智能体(AI Agents)出场了。它在大语言模型的外面套上了一个控制循环:- 设定目标- 规划步骤- 执行行动- 回顾反思AI智能体并不仅仅是回答问题那么简单,它能自主地去研究一个话题、收集数据、撰写报告,甚至帮你发邮件,全程自动化。---> 真正的生产级AI,要同时用好这三者 <很多酷炫的AI展示,其实只是单纯用了LLM再配上花里胡哨的提示词。但真正能落地的AI系统,往往同时结合了这三个要素:- LLM 提供推理和思考能力- RAG 确保知识准确而新鲜- AI智能体 则提供行动和决策能力---> 如何选用这三者? <- 只用LLM 如果你需要纯语言的任务,比如写作、摘要、解释。- LLM + RAG 如果你需要回答涉及特定文档、技术手册、专业领域知识的问题,并确保答案准确无误。- LLM + RAG + AI 智能体 如果你需要真正的自主行动,比如系统自己决策、执行任务、管理复杂流程。---> AI的未来,不是选哪一种,而是如何把这三层架构起来 <记住这个公式:- LLM负责思考- RAG负责知识- AI智能体负责行动真正的AI智能系统,就是这三者协同起来,形成一个完整的智能架构。来源:x.com/connordavis_ai/status/1985663551697273216
新浪微博 2025-11-06 00:00:00
13. 如何系统性的学习RAG、Agent、MCP?
知乎 2025-11-29 00:00:00
14. Obsidian 搭配什么AI工具 ?Codex篇 保姆上手教程 ClaudeCode 对比
哔哩哔哩 2026-04-08 00:00:00
15. 《扣子开发 AI Agent 智能体应用》014-基于大模型的企业知识库(知识库的理论基础 RAG)
微信公众号 2026-01-02 00:00:00
16. 基于 Ray 的蚂蚁数据构建引擎在搜推、RAG 场景的实践
知乎 2026-03-13 00:00:00
17. 用我们自家的AI,普通人也能享用优秀分析师的服务#AI #Reportify #商业研究 #智能体
抖音 2025-11-11 00:00:00
18. Boris(Claude Code 创始人)解释为什么 Claude Code 不用 RAG 向量检索代码:在开发 Claude Code 的早期版本时,我们曾尝试过 RAG 搭配本地向量数据库的方案。但很快我们就发现,Agent 使用关键字搜索在实际应用中的表现通常要出色得多。这种方案不仅实现起来更加简洁,而且还完美避开了 RAG 模式下那些令人头疼的“老毛病”:比如数据安全性、隐私泄露风险、信息滞后以及系统可靠性等问题。
新浪微博 2026-02-01 00:00:00
19. Milvus 向量数据库实战:从零构建高性能 RAG 系统
知乎 2026-01-12 00:00:00
20. 为什么 RAG 落地难?解析数据处理 “三重困境”,事件驱动架构如何破局?
知乎 2025-11-25 00:00:00
21. 做了个RAG评估小框架开源做RAG时发现,麻烦的往往是数据处理到评估的那条流水线。所以顺手写了个工具,用中文数据集做基准,内置标准流程,方便快速试不同的检索和生成方案平时主要用它两件事,一是快速验证新想法,不用重复写脚本,二是在同一套指标下对比不同策略,看问题出在哪#rag#
新浪微博 2025-12-09 00:00:00
22. RAG的主流类型 第二期
小红书 2026-01-24 00:00:00
23. 大模型RAG技术全解析
知乎 2025-12-01 00:00:00
24. 为什么我不再相信RAG?实战RAG弊端揭秘
知乎 2025-11-30 00:00:00
25. PageIndex 能替代传统RAG吗?
今日头条 2026-01-23 00:00:00
26. 别再只会写普通RAG了!试试Agentic RAG
小红书 2026-03-09 00:00:00
27. 2026年构建RAG系统的核心策略
知乎 2026-03-26 00:00:00
28. RAG实战(第一部分)
知乎 2026-04-06 00:00:00
29. 第五章
知乎 2026-04-04 00:00:00
30. RAG 入门指南
微信公众号 2026-04-04 00:00:00
31. RAG的老酒,装在Mintlity的新瓶ChromaFs获得了460倍性能提升
微信公众号 2026-04-06 00:00:00
32. 如何选择AI知识库架构?深度解析RAG、GraphRAG与微调方案
微信公众号 2026-04-04 00:00:00
33. 别再瞎调 chunk_size 了!我从零搭建 RAG 学到的 10 条经验
知乎 2026-04-02 00:00:00
34. 大模型RAG技术,从入门到精通,一文彻底搞懂RAG
知乎 2026-04-02 00:00:00
35. 大模型入门第十一课
知乎 2025-12-17 00:00:00
36. RAG小白入门指南
知乎 2026-03-03 00:00:00
37. 产品经理视角的RAG技术入门指南
今日头条 2025-12-06 00:00:00
38. RAG检索增强生成
知乎 2026-02-26 00:00:00
39. RAG 完全指南
知乎 2026-03-12 00:00:00
40. RAG入门
知乎 2026-01-19 00:00:00
41. RAG 避坑指南
知乎 2026-01-20 00:00:00
42. RAG文档处理策略
知乎 2025-12-12 00:00:00
43. 在RAG文档处理中——表格数据的处理思路
知乎 2026-01-16 00:00:00
44. 从知识增强到微调
哔哩哔哩 2026-03-30 00:00:00
45. 范式革新!A-RAG如何让大模型自主掌控检索,突破传统RAG瓶颈?
知乎 2026-02-13 00:00:00
46. LLM中的向量RAG与Graph RAG
知乎 2026-03-03 00:00:00
47. AI应用开发
今日头条 2026-04-04 00:00:00
48. 花两天拆了 Dify RAG 源码,跟自己写的 RAG 对比后,我才知道差距在哪
知乎 2026-04-06 00:00:00
49. 大厂都在用的 RAG 架构,我踩过的坑都在这儿了
微信公众号 2026-04-09 00:00:00
50. 从检索到生成,RAG效果评估全链路拆解,面试应答这样说才加分
今日头条 2025-12-09 00:00:00
51. 大模型检索增强生成(RAG)实战
微信公众号 2026-04-06 00:00:00
52. AI工具怎么搭配更划算
微信公众号 2026-03-07 00:00:00
53. 不用RAG, AI永远不可靠
微信公众号 2026-04-08 00:00:00
54. RAG
今日头条 2025-11-09 00:00:00
55. RAG的多路召回是如何实现的?
知乎 2026-04-07 00:00:00
56. AI产品经理一图流
小红书 2026-03-20 00:00:00
57. 人话版AI词典 | 第9期
知乎 2026-04-03 00:00:00
58. OpenClaw私有RAG实战
微信公众号 2026-04-03 00:00:00
59. RAG
微信公众号 2026-04-05 00:00:00
60. RAG小助手,让AI记住你的秘密文件
微信公众号 2026-04-06 00:00:00
61. 一篇搞明白!MCP、RAG、Agent
微信公众号 2026-04-07 00:00:00
62. 从RAG到Agentic RAG 的进化之路
微信公众号 2026-03-27 00:00:00
63. 收藏!一文读懂RAG技术选型:从入门到企业级实践全攻略
今日头条 2025-12-04 00:00:00
64. 简单RAG系统!n8n + 谷歌造出企业级知识库
小红书 2025-11-27 00:00:00
65. 本地化部署大模型-RAG 叠加
知乎 2025-11-04 00:00:00
66. 面试常问的RAG文本向量检索不准怎么办?
今日头条 2026-04-08 00:00:00
67. Claude Code 外接知识库终极指南:50+ RAG 工具全景对比 | MCP · 多模态 · 选型指南
哔哩哔哩 2026-03-03 00:00:00
68. 告别“傻叉“被动式RAG!主动式RAG让AI像人类一样思考,效率提升10倍!
知乎 2025-12-31 00:00:00
69. 一个实习生,用三天时间搭出了一个"公司知识问答机器人"
微信公众号 2026-04-04 00:00:00
70. RAG资料包上线: 让你的AI不再“胡说八道”——从入门认知到实战落地,AI开发者的第一堂课
知乎 2025-10-27 00:00:00
71. AI面试常挂题!"评估RAG效果"新手盯指标,老鸟却栽在产品视角上
今日头条 2025-12-09 00:00:00
72. 蚂蚁面试官追问:"你的 RAG 系统首字响应要
小红书 2026-03-10 00:00:00
73. RAG 系统优化实战:从 2 秒到 200ms 的 9 个关键优化点
微信公众号 2026-03-29 00:00:00
74. 全网最实用免费AI学习地图(5)告别AI幻觉,打造专属个人知识库
微信公众号 2026-01-26 00:00:00
75. RAG高级调优指南:三大方向提升检索效率
微信公众号 2026-02-08 00:00:00
76. 9个RAG调优方法——高级RAG
小红书 2025-12-20 00:00:00
77. 你现在用到第几种 RAG 了?
小红书 2025-12-29 00:00:00
78. 6.1K Star!AI工程师必收藏!22种RAG技术全实现,从入门到王者的开源宝典!
知乎 2025-12-16 00:00:00
79. 在RAG架构中,如何为你的AI Agent选择最佳“长时记忆”
今日头条 2026-01-07 00:00:00
80. 动手实现RAG
今日头条 2025-10-19 00:00:00
81. 面试高频题:RAG 为何越用越慢?性能调优策略全解析
知乎 2025-11-26 00:00:00
82. 如何量化评估RAG系统效果
小红书 2025-11-02 00:00:00
83. RAG调优实战(一)精准锁定,2个优化让准确率3倍提升
微信公众号 2026-01-30 00:00:00
84. 艾体宝干货 | RAG技术对比:向量数据库和ArangoDB知识图谱GraphRAG
微信公众号 2026-04-04 00:00:00
85. RAG应用性能优化入门指南 检索增强生成(RAG)通过向量检索与大语言模型结合,使AI能运用私有数据构建知识问答等应用。其核心流程分为数据索引(分块、向量化)与查询(检索、合成)两阶段。但朴素RAG常面临检索质量不佳(低精确率/召回率)和大模型幻觉两大核心挑战,限制了实际效果。 建立评估体系是优化的基石,需从两个维度入手:检索器评估(衡量文本块相关性,使用命中率、NDCG等指标)和端到端评估(衡量最终答案质量)。评估数据集可通过人工标注、用户反馈或强模型合成生成,为持续迭代提供衡量标尺。 基础优化技术投入小见效快:调整文本块大小是最关键一步,过长上下文会导致"中间丢失"现象。应通过实验找到平衡检索精度与上下文质量的最佳尺寸。添加元数据过滤(如年份、标题)可在语义搜索基础上实现精准定位,如同SQL的WHERE子句,大幅提升精确率。 进阶策略巧妙平衡精度与上下文:"小块到大块检索"解耦检索与合成单元——索引细粒度小块提升精度,合成时扩展为大块保证上下文完整。优化嵌入内容(如使用摘要或预生成的假设性问题而非原文)能进一步提升检索精准度,同时保留完整文本供生成使用。 前沿技术释放RAG全部潜力:多文档智能体将文档视为可调用的工具集(如总结、问答),能自主规划多步骤完成跨文档综合分析。模型微调分为两类:检索微调(优化嵌入模型理解领域术语)和合成微调(通过知识蒸馏让弱模型学习强模型能力)。 优化应循序渐进:基础技术解决噪音与遗漏,进阶策略平衡精度与上下文,前沿探索实现复杂推理。牢记所有优化始于可靠评估体系,需根据具体场景持续迭代,方能构建真正高性能的RAG应用。 #RAG #优化
抖音 2025-12-27 00:00:00
86. 利用AI Agent搭建RAG系统
微信公众号 2026-04-05 00:00:00
87. 构建AI智能体:二十三、RAG超越语义搜索:如何用Rerank模型实现检索精度的大幅提升
知乎 2025-11-15 00:00:00
88. 学 RAG 找工具找到头秃的日子终于结束😭
小红书 2025-10-21 00:00:00
89. 从80%到90%:一个开发者亲历的RAG系统优化之路
知乎 2025-12-19 00:00:00
90. 7.5K Star!开源AI笔记神器Blinko,卡片式速记+RAG检索,隐私优先的灵感捕手
微信公众号 2025-12-19 00:00:00
91. 蒙帕视角丨什么是 Naive RAG?— RAG 架构演进之路的起点
微信公众号 2026-04-08 00:00:00
92. 大模型RAG
知乎 2026-03-27 00:00:00
93. AI基础 | 融合知识图谱的检索增强生成(RAG)
微信公众号 2026-03-27 00:00:00
94. 智能检索工具Perplexity
微信公众号 2026-01-30 00:00:00
95. 137期工具精选:9大类别全覆盖,从下载加速到RAG框架的实用工具盛宴
微信公众号 2026-04-10 00:00:00
96. 08|工具篇:让模型学会“查资料”——RAG与Toolformer的实践
知乎 2026-03-30 00:00:00
97. CER:证据对比Re-Ranking低成本为RAG添加可解释性
微信公众号 2025-12-08 00:00:00
已收藏
去我的收藏夹