RAG检索准确率优化实战:从问题诊断到场景化落地

源自168位全网作者

06-08 08:58

内容由AI生成

精选参考来源

1. Milvus 向量数据库实战:从零构建高性能 RAG 系统

2. AI 术语通俗词典:RAG

3. 基于 Ray 的蚂蚁数据构建引擎在搜推、RAG 场景的实践

4. AI 术语通俗词典:交叉验证

5. 做了个RAG评估小框架开源做RAG时发现,麻烦的往往是数据处理到评估的那条流水线。所以顺手写了个工具,用中文数据集做基准,内置标准流程,方便快速试不同的检索和生成方案平时主要用它两件事,一是快速验证新想法,不用重复写脚本,二是在同一套指标下对比不同策略,看问题出在哪#rag#

6. 整个 RAG 行业即将被颠覆。 研究人员开发了一种新的 RAG 方法,它: - 不需要向量数据库。 - 不嵌入数据。 - 不涉及分块。 - 不进行相似性搜索。 它被称为 PageIndex。与其将文档分块并塞入 Pinecone,不如构建一个树索引,让 LLM 像人类阅读书籍一样推理。 在 financebench 上达到了 98.7%。在排行榜上击败了所有向量 RAG。 无嵌入。无分块。无向量数据库。 100% 开源。

7. 【文档越多检索越不准?高维向量空间的语义坍缩真相】快速阅读:随着文档量增加,高维向量空间的语义边界会变得模糊,导致检索精度大幅下降。解决办法在于从单纯的“搜索”转向基于图结构的“推理”。把成千上万的文档一股脑塞进 RAG,就像试图在一个溢出的堆内存里寻找一个特定变量。随着文档量突破 10,000 这个临界点,语义空间开始变得拥挤。原本清晰的特征簇在极高维度的压缩下逐渐重叠,每个向量看起来都和别的向量“挺像”。斯坦福的研究揭示了这种现象:当规模达到 5 万份文档时,检索精度会暴跌 87%。这其实就是维度灾难。在高维空间里,数据点趋向于分布在边缘,彼此之间的距离变得几乎相等。此时的语义搜索,找出来的不再是那个最精准的答案,而是一堆看起来都“相关”的噪声。有观点认为,这种现象源于工程实现的局限。目前的做法太过于依赖扁平化的向量检索。真正的知识不是散落在空间里的孤立点,而是一张带有层级、时效和权威性的图。如果只做余弦相似度计算,就无法处理法律条文被废止或辖区变更这种逻辑关联。解决路径正从“增加数据量”转向“优化检索结构”。通过 GraphRAG 引入关系约束,或者利用局部上下文窗口来规避全局坍缩。知识的价值在于连接,而非单纯的堆砌。twitter.com/HowToAI_/status/2043713987171492224

8. 从RAG到记忆工程:AI长期记忆系统的架构范式与落地瓶颈

9. 《REFRAG: Rethinking RAG based Decoding》Meta最新发布的REFRAG技术,彻底解决了检索增强生成模型(RAG)最大的瓶颈:解码效率低下。相比传统RAG,REFRAG实现了30倍更快的首词生成速度,同时保持零准确率损失。问题核心在于:RAG在输入大量检索段落时,实际只有5-10段内容对生成有用,剩余多数成为计算负担,但模型仍对所有段落进行全面注意力计算,导致时间和内存资源巨大浪费。传统RAG用16K上下文时,首次输出延迟超过100秒,吞吐量下降10倍,内存消耗爆表。REFRAG通过将上下文块压缩成单一嵌入向量,避免了对全部16,384个token的逐一处理,仅需处理约1,024个压缩块嵌入,极大减少计算量。成果显著:- 首词生成速度提升30.85倍- 语义困惑度(perplexity)无损失- 上下文容量扩展16倍(4K token → 64K token)- 性能超越前沿技术3.75倍为何行得通?因为RAG的注意力模式稀疏,大多数检索段落间无交互。REFRAG通过以下三点巧妙利用这一点:1. 预计算并缓存嵌入,推理时重复使用2. 基于强化学习的压缩策略,智能决定哪些块需展开3. 不受位置限制,任意位置均可压缩实际应用优势:- 仅8段文本的延迟即可达到单段处理速度- 在检索器性能较弱时,依然提升准确率- 可支持无限长会话历史- 无需修改基础模型架构这项技术改变了RAG的计算经济学:更多上下文、更低延迟,且成本更优。REFRAG不仅是性能优化,更是RAG从“功能”向“基础设施”转型的关键一步。它告诉我们,提升AI系统效率的关键不在于盲目增加计算资源,而是精准减少无效计算,压缩信息冗余,从根本上优化流程。更多细节和论文链接见:arxiv.org/abs/2509.01092这背后,技术创新带来的不仅是速度,更是未来大规模长文本理解与生成的基石。希望更多开发者和研究者能从中得到启发,推动RAG技术应用迈入新阶段。

10. //@程序员金俊:虽然 PageIndex 在“深度理解单篇/少量复杂文档”上超越了传统 RAG,但它也有非常明显的局限性: 极高的 Token 消耗与延迟:传统的向量检索是毫秒级的计算。而 PageIndex 每回答一个问题,都需要 LLM 介入进行多次思考和树节点遍历。这会导致巨大的 Token 吞吐量和长达数秒(甚至十几秒)的 Latency。在关注运行成本和产出比的工程实践中,这是一笔必须精确计算的开销。 不适合海量文档的“广度搜索”:如果你有个包含一万份短小碎文档的 PostgreSQL 知识库,要在其中“大海捞针”,传统的 Embedding + 向量检索引擎依然是无可替代的最佳选择。 依赖原始数据的结构化质量:树状索引的质量决定了检索的上限。如果输入的 PDF 是一份排版混乱、毫无标题层级的纯扫描件,PageIndex 赖以生存的导航地图就会失效。 总结: PageIndex 并没有淘汰向量 RAG,而是开辟了另一个赛道。向量 RAG 擅长处理“海量、碎片、无结构”的广度召回,而 PageIndex 是一个用来对付“单点、长篇、高结构化”硬核文档的精读智能体。未来更合理的架构,很可能是两者的融合(Hybrid):用向量做初步过滤,用 PageIndex 的树检索做精准的深度穿透。

11. RAG退潮,“文件系统+grep”回归,智能体检索的返璞归真

12. 一篇讲清RAG、LangChain、Agent三者关系!

13. 《扣子开发 AI Agent 智能体应用》028-实战案例:智能客服

14. 谷歌Gemini Embedding 2公测跨模态检索打通首个原生多模态嵌入模型,简单说就是把文本、图片、视频、音频、PDF全扔进同一个向量空间,搜东西一下子打通了最实用的几个场景:文字搜图片,输入“雨中撑伞的复古女孩”,模型能从图库里精准拉出匹配图;图片搜视频,上传一张“街头滑板少年”照,能找出相似动作片段;还能图片搜图、图文混搜文档召回率和精度比之前方案高不少,电商找同款、短视频推荐、法律档案检索都能用现在Gemini API和Google AI Studio可以直接调用gemini-embedding-2-preview,输出维度可调,延迟低,支持100多种语言。想升级多媒体搜索或RAG的,可以直接上手测,效果确实香#谷歌gemini#

15. LightRAG 是一个简单快速的检索增强生成(RAG)框架,能高效整合大语言模型和知识图谱,实现智能文档查询和多模态检索。LightRAG支持多种存储方案(PostgreSQL、Neo4j、Milvus、OpenSearch等),支持文本、图片、表格、公式等多种数据类型的端到端知识抽取和问答。还提供了丰富的示例代码、Web UI,以及支持OpenAI、Hugging Face、Ollama、Azure OpenAI等多家模型接口。项目亮点:- 灵活配置的多存储架构,适合大规模知识管理;- 深度集成知识图谱构建与编辑,支持实体关系管理、知识图谱可视化;- 支持强大的Reranker提升检索效果;- 新增RAG-Anything,打通多模态文档处理与检索能力;- 丰富文档导入格式、引用功能、缓存管理、Token使用统计;- 还支持Langfuse可观测性监控以及RAGAS自动评价指标。无论是科研研究、企业知识库、还是多模态智能问答应用,LightRAG都提供了极具扩展性且高性能的解决方案。GitHub:github.com/HKUDS/LightRAG#在线智能检索# #知识图谱# #大语言模型# #RAG# #开源项目#

16. GitNexus 是一个把代码库自动转成“知识图谱”的工具,并在此基础上提供 Graph-RAG 与 AI 对话能力,用于让人和 AI 更快理解大型代码库。特点:零服务器、浏览器本地运行、隐私优先。核心能力:1、代码 → 知识图谱项目通过 AST 分析构建图结构。这套流程采用四阶段分析:1)结构扫描2)AST 解析3)依赖解析4)调用图构建最终得到完整代码图。2、Graph-RAG 代码问答与传统 RAG 不同,GitNexus 的检索是图查询。AI 通过 Cypher 查询或图遍历获取上下文,比 embedding 检索更精确。3、零服务器隐私架构项目最突出的设计之一:1)所有分析在浏览器本地运行2)代码不上传服务器3)数据库为 WASM 版图数据库4)API key 本地保存适合企业代码安全场景。4、面向 AI Agent 的设计GitNexus 不只是可视化工具,而是 Agent 基础设施。它能提供:1)影响范围分析2)依赖追踪3)架构检查4)自动化审计目标是让 AI 编程助手具备“架构感知能力”。项目:github.com/abhigyanpatwari/GitNexus#HOW I AI# #程序员# 黄建同学的微博视频

17. WWW 2026|让MoE路由拥有「记忆」:RMS-MoE用检索记忆协同实现更高效专家调度

18. Agent 框架记忆问题的解法~用过 LangChain、CrewAI 这些 Agent 框架的都知道一个痛点:它们的记忆管理很鸡肋。大多数框架的做法是:短期放在列表里,长期靠 RAG 检索。听起来合理,实际很脆弱。问题在哪?1. 信息丢失。RAG 只会检索出片段,但对话的整体脉络、为什么重要、前后的因果关系都丢了。用户说"上次那个项目",Agent 可能查出相关文档,但根本不知道用户为什么关心这个项目。2. 幻觉加倍。Agent 基于零碎的检索结果推理,没有全局认知,自然容易编造细节。3. 记忆冲突。同一件事在不同时间表述可能不一样,Agent 也不知道哪个才是"真相",结果前后矛盾。核心问题:RAG 本质是"我记不全,就检索部分"——但这对需要全局一致性的 Agent 任务来说,根本不够。文章的解法:混合记忆架构,不是非此即彼,而是分层:第一层:实时记忆 —— 最近 N 轮对话完整保留,一个字都不丢。这保证了 Agent 对当前对话的理解是准确的。第二层:压缩记忆 —— 更早的对话不是直接存,而是压缩成摘要。比如 50 轮对话压缩成"5 个关键决定 + 3 个重要背景"。成本低,还保留了信息密度。第三层:语义检索 —— 用向量数据库索引压缩后的记忆。这样检索时找的是"高浓度摘要",而不是淹没在海量文档里。第四层:验证 —— 最关键的一步。Agent 每次从记忆里检索出来东西,要自己验证一下:"这个旧记忆和我现在的对话一致吗?"不盲目信任。为什么这个方案值得用?1. 解决了 RAG 的致命问题——记忆有连贯性,Agent 知道全局脉络,不再前后不一。2. 成本可控——压缩记忆大幅降低向量库规模和 token 消耗,相比把所有历史都存下来,省一个数量级的钱。3. 可验证——加验证层,Agent 不会死板地信任过期的记忆。适用场景:- 长期对话的 AI 助手(用户期望 Agent 真的"记得我们的历史")- 复杂多轮谈判或诊断(需要一致决策,不能前后矛盾)- 需要积累知识的任务流不适用的场景:- 单轮或短对话(没必要这么复杂)- 纯知识库查询(RAG 本身够用)原文:dev.to/diego_falciola_02ab709202/every-ai-agent-framework-has-a-memory-problem-heres-how-i-fixed-mine-1ieo#HOW I AI# #程序员#

19. 文档平台 Mintlify 发了一篇工程博客,讲了一件挺有意思的事:他们给自家 AI 文档助手造了一套假的文件系统,叫 ChromaFs,让 AI 以为自己在用 grep、cat、ls 这些命令浏览文件,实际上每个命令都被拦截、翻译成了数据库查询。效果很直接:会话启动时间从原来沙箱方案的 46 秒降到 100 毫秒,每次对话的边际计算成本几乎为零。Mintlify 之前的方案是标准的 RAG 流程:把文档切块、向量化、存进 Chroma 数据库,用户提问时检索最相关的片段喂给大模型。问题是,如果答案分散在好几个页面里,或者用户要的是某段精确的代码语法,向量检索经常找不对。他们想让 AI 像开发者翻代码一样翻文档,而不是靠语义相似度碰运气。核心思路是:AI 不需要真的操作系统,只需要一个足够逼真的幻觉。ChromaFs 基于 Vercel Labs 的开源项目 just-bash(一个用 TypeScript 重写的 bash 子集)构建。just-bash 提供了可插拔的文件系统接口,负责解析命令和管道逻辑,ChromaFs 则把所有底层文件操作翻译成 Chroma 数据库查询。每个文档页面变成一个"文件",每个章节变成一个"目录",AI 就可以用 grep 搜精确字符串、用 cat 读整页内容、用 find 遍历结构。之前用真沙箱的方案(给每个用户起一个微型虚拟机),按 Mintlify 月均 85 万次对话的量算,一年光计算成本就要 7 万美元以上。ChromaFs 复用了已有的数据库基础设施,这笔钱省了。grep 是最难虚拟化的命令。如果真让它逐文件扫描,走网络 IO 会很慢。ChromaFs 的做法是先把 grep 的参数解析出来,用 Chroma 的元数据查询做粗筛,找出可能命中的文件批量预取到缓存里,再让 just-bash 在内存中做精确匹配。权限控制也很优雅:初始化时根据用户身份裁剪文件树,没权限的路径直接从树里删掉,AI 连路径都看不到,不存在越权风险。所有写操作一律返回"只读文件系统"错误,AI 能随便看但改不了任何东西,整个系统无状态,不用担心清理和数据污染。这篇文章在 Hacker News 上引发了一个有意思的讨论。好几位开发者指出,大家不知不觉中把 RAG(检索增强生成)等同于了向量搜索,但 RAG 里的 R 是 Retrieval(检索),本来可以是任何方式:全文搜索、SQL 查询、甚至翻电话簿。把 RAG 绑死在向量数据库上,是早期技术路径的惯性。有人解释了这种惯性的由来:RAG 概念流行的时候,大模型还不太会用工具,多轮搜索和纠错能力也差,向量检索是当时最省事的方案。现在模型的工具调用和推理能力上来了,让 AI 自己决定用什么方式找信息,反而比预设一条检索管道更灵活。也有人提出了务实的质疑:Mintlify 的场景是结构化的技术文档,天然适合文件系统隐喻,但如果是组织内部那种乱七八糟、没有层级结构的知识库,这套方案未必好使。这个方向和 Claude Code 的做法有相通之处:与其把所有信息预检索好喂给模型,不如给模型一套探索工具,让它自己决定看什么、怎么找。对于正在搭建 AI 文档助手或内部知识库的开发者来说,Mintlify 的这套方案提供了一个向量检索之外的选项,尤其适合文档结构清晰、对精确匹配要求高的场景。

20. Boris(Claude Code 创始人)解释为什么 Claude Code 不用 RAG 向量检索代码:在开发 Claude Code 的早期版本时,我们曾尝试过 RAG 搭配本地向量数据库的方案。但很快我们就发现,Agent 使用关键字搜索在实际应用中的表现通常要出色得多。这种方案不仅实现起来更加简洁,而且还完美避开了 RAG 模式下那些令人头疼的“老毛病”:比如数据安全性、隐私泄露风险、信息滞后以及系统可靠性等问题。

21. github.com/Tencent/WeKnora 腾讯开源的RAG框架:WeKnora(维娜拉) 这是一款基于大语言模型的文档理解与语义检索框架,专为结构复杂、内容异构的文档场景而打造。 框架采用模块化架构,融合多模态预处理、语义向量索引、智能召回与大模型生成推理,构建起高效、可控的文档问答流程。核心检索流程基于 RAG(Retrieval-Augmented Generation) 机制,将上下文相关片段与语言模型结合,实现更高质量的语义回答。 核心特性 🤖 Agent模式:支持ReACT Agent模式,可调用内置工具检索知识库、MCP工具和网络搜索,通过多次迭代和反思给出全面总结报告 🔍 精准理解:支持 PDF、Word、图片等文档的结构化内容提取,统一构建语义视图 🧠 智能推理:借助大语言模型理解文档上下文与用户意图,支持精准问答与多轮对话 📚 多类型知识库:支持FAQ和文档两种类型知识库,支持文件夹导入、URL导入、标签管理和在线录入 🔧 灵活扩展:从解析、嵌入、召回到生成全流程解耦,便于灵活集成与定制扩展 ⚡ 高效检索:混合多种检索策略:关键词、向量、知识图谱,支持跨知识库检索 🌐 网络搜索:支持可扩展的网络搜索引擎,内置DuckDuckGo搜索引擎 🔌 MCP工具集成:支持通过MCP扩展Agent能力,内置uvx、npx启动工具,支持多种传输方式 ⚙️ 对话策略:支持配置Agent模型、普通模式模型、检索阈值和Prompt,精确控制多轮对话行为 🎯 简单易用:直观的Web界面与标准API,零技术门槛快速上手 🔒 安全可控:支持本地化与私有云部署,数据完全自主可控 #科技先锋官#

22. 随着 Karpathy 分享的 LLM 知识库工作流走红,大家都在折腾 RAG 和 Agent。其实 Google 的 NotebookLM 已经是个现成的专业分析器,几分钟就能把一个 YouTube 频道变成你的私人知识库。以分析 Peter Attia 的播客为例,我的以下流程完全不需要安装第三方工具,操作极简:1. 访问: Chrome 打开 YouTube 频道的 Video 页面。2. 一行代码: 打开 Chrome DevTools (F12) -> Console,同时 youtube 手工滚动往下面多加载一些视频,然后输入以下代码到 console 获取所有视频 URL:// 获取当前页面所有视频链接的代码var urls = Array.from(document.querySelectorAll('a#video-title-link')).map(a => a.href);console.log(urls.join('\n'));3. 导入 Source: 新建 Notebook -> Add Source -> Website,批量粘贴 URL,注意单个 notebook 最大 50 个4. 即时对话: 导入后,你就可以直接基于知识库提问:“根据 Peter 的理论,我该如何设计训练计划?”,效果见图2。优势: 不用折腾 Token 成本,不用调优 Embedding,NotebookLM 访问 Google 内部资源比如 youtube 视频尤其有优势。

23. 多模态 RAG 才是企业知识库低效瓶颈的解药?

24. 【AI记忆系统突破99%准确率:用Agent完全替代向量数据库】快速阅读: Supermemory团队用多智能体协作系统在长期记忆基准测试LongMemEval上达到99%准确率,核心突破是用3个并行搜索Agent替代传统向量检索,让AI通过“理解”而非“数学相似度”来回忆信息。这套方案不需要向量数据库,甚至可以嵌入机器人。---向量数据库可能不是AI记忆的最优解。Supermemory在LongMemEval基准测试(11.5万token对话历史)上达到99%准确率,用的方法反而更简单:完全抛弃向量检索,改用多个Agent协作。传统RAG的问题出在检索环节。语义相似度匹配根本分不清“旧事实”和“新更正”,当检索结果里混杂太多噪音,大模型就会迷失。他们的解法是ASMR(Agentic Search and Memory Retrieval):信息摄取阶段,3个并行Observer Agent同时读取对话记录,按照个人信息、偏好、事件、时间数据等六个维度提取知识点,直接存储结构化内容而非生成embedding。检索阶段才是关键。面对提问时不查询数据库,而是派出3个专门的搜索Agent——一个找直接事实,一个挖隐含语境,一个重建时间线。这些Agent是在“主动阅读和推理”,不是在做向量余弦计算。回答阶段用了两种策略测试。第一种是8个高度专业化的prompt变体并行运行(精确计数专家、时间专家、上下文深挖专家等),只要任何一条推理路径答对就算成功,准确率98.6%。第二种是12个Agent独立作答后,由一个聚合器LLM综合投票裁决,准确率97.2%。有观点认为这套系统证明了“认知理解”比“数学相似性”更适合处理记忆任务。数学只能捕捉表层模式,而Agent可以处理时间序列中的矛盾、更新和细微差别。更有意思的是,这个架构完全在内存中运行,不依赖外部向量数据库,理论上可以部署到任何设备,包括机器人。他们11天后会开源全部代码。当数十亿个高度个性化的AI Agent开始学习和记住我们的一切时,记忆系统的天花板在哪里?也许不在算力,而在我们愿意给Agent多少“主动思考”的权限。ref: x.com/DhravyaShah/status/2035517012647272689#AI创造营##人工智能#

25. 构建智能问答系统通常面临查询模糊、上下文理解不足和检索效率低等挑战。Agentic RAG for Dummies 是一个基于 LangGraph 的极简 Agentic RAG(检索增强生成)框架,帮助你用最少代码快速搭建具备会话记忆和人机交互查询澄清能力的生产级系统。 项目集成了多功能模块: - 会话记忆,保持对话上下文连贯; - 智能查询澄清,自动重写或请求补充信息; - 分层索引,实现精准且上下文丰富的检索; - 多Agent并行处理复杂多问; - 灵活切换多种大语言模型(Ollama、OpenAI、Google Gemini 等); - 开箱即用的 Gradio Web UI,方便体验和部署。 无论是学习 RAG 基础,还是构建定制化应用,这个项目都提供了交互式笔记本和模块化代码两条路径,助力开发者快速上手并轻松扩展。 GitHub 地址:github.com/GiovanniPasq/agentic-rag-for-dummies/ 主要功能: - 支持多轮对话记忆,提升问答自然度; - 自动拆分复杂查询,精准定位信息点; - 结合关键词稀疏向量和语义稠密向量的混合检索; - 内置人机交互机制,避免误解或无效查询; - 多Agent协同,提升复杂问题的处理效率; - 完整文档处理流水线,支持 PDF 转 Markdown 及分块索引。 适合 AI 研究者、开发者及数据工程师,轻松构建满足生产需求的智能问答系统。

26. DeepLearning AI 吴恩达和 Qdrant新出的这个课程看起来不错。Multi-Vector Image Retrieval,大多数检索系统都会用单个向量来表示一张图像。本课程展示了多向量方法如何将图像表示为由多个嵌入组成的集合,从而在文本查询与视觉内容之间实现更加精确的匹配,尤其适用于包含图片、图表和文字混合的文档场景。1 实现 ColBERT,用于理解多向量文本检索与延迟交互式搜索。2 应用 ColPali,从图像中提取更细粒度的局部补丁级特征,用于精细视觉检索。3 通过量化与池化技术优化内存占用。4 将多向量输出转换为 MUVERA 向量,以加速基于 HNSW 的快速检索。5 构建一个多模态 RAG 流水线,用于检索并推理复杂的视觉类文档。访问:learn.deeplearning.ai/courses/multi-vector-image-retrieval/#ai创造营# #程序员#

27. 如何看待阿里开源的Qwen3-VL-Embedding 和 Qwen3-VL-Reranker 模型?

28. 字节火山开源的上下文数据库OpenViking, 专为 AI Agent 设计。该项目通过文件系统范式,统一管理智能体所需的记忆、资源与技能,解决了传统 RAG 架构中信息碎片化和检索低效的问题。1. 文件系统管理范式 → 解决碎片化问题:基于文件系统范式,将记忆、资源、技能进行统一上下文管理;2. 分层上下文按需加载 → 降低 Token 消耗:L0/L1/L2 三层结构,按需加载,大幅节省成本;3. 目录递归检索 → 提升检索效果:支持原生文件系统检索方式,融合目录定位与语义搜索,实现递归式精准上下文获取;4. 可视化检索轨迹 → 上下文可观测:支持可视化目录检索轨迹,让用户能够清晰观测问题根源并指导检索逻辑优化;5. 会话自动管理 → 上下文自迭代:自动压缩对话中的内容、资源引用、工具调用等信息,提取长期记忆,让 Agent 越用越聪明。项目:github.com/volcengine/OpenViking#HOW I AI# #过个有ai年#

29. AI Agent开发常常需要管理海量对话历史,传统RAG或知识图谱难以实现真正学习,记忆准确率低、长期遗忘严重。Hindsight™ 提供革命性的Agent记忆系统,让AI Agent真正"学会"而非仅"记住"。不仅在LongMemEval基准测试中创下最优性能,还支持世界事实、个人经历、心理模型构建,已被Fortune 500企业投入生产。GitHub:github.com/vectorize-io/hindsight主要功能:- 记忆保留(Retain):自动提取实体、关系、时序数据构建知识库;- 智能回忆(Recall):语义+关键词+图谱+时序四路并行检索;- 深度反思(Reflect):基于记忆生成洞察和决策建议;- 多用户记忆隔离:支持按用户/会话隔离记忆管理;- 生物仿生架构:模拟人类记忆机制(世界事实+经历+心理模型);- 一行代码集成:LLM Wrapper自动为现有Agent添加记忆能力。支持Docker一键部署、Python/Node.js客户端、嵌入式模式,兼容OpenAI/Anthropic等多种LLM提供商。#AIAgent##AgenticAI##人工智能#

30. 说实话,我认为记忆力是目前持续学习的最大障碍。让我夜不能寐的问题是:我们如何利用记忆避免重蹈覆辙?我们如何教会模型有选择地记忆和遗忘?何时呈现正确的背景信息?人类通过记忆巩固、干扰管理和情境绑定自然而然地做到这一点,然而,我们尚未找到复制这种机制的方法。人类海马系统与当前LLM记忆架构之间的差距揭示了一个根本性的挑战:我们基本上构建了两个极端:要么是将所有信息都硬编码到参数中的模型(刚性模型),要么是使用RAG(随机数生成器)机械地检索信息(模糊模型)。真正的持续学习要求我们破解智能检索的密码;不仅要知道存储什么,还要知道抑制什么、何时强化,以及如何让旧知识优雅地消退而不造成灾难性的干扰。非常喜欢这篇调查,因为它从宏观角度展现了 LLM 和多模态模型中的记忆架构(也很喜欢其中受大脑启发的分类法,很棒!)。我会尽我所能系统地绘制出它的图谱。三部分框架:他们围绕新皮层-海马体-前额叶皮层的类比来构建记忆:内隐记忆/新皮层涵盖了嵌入模型权重中的参数知识,包括记忆编辑技术(如 ROME 和 MEMIT,它们通过精确修改权重来更新事实)、通过 LoRA 等适配器注入知识,以及通过记忆遗忘来删除有害内容。显性记忆/海马体研究外部检索系统;RAG架构、向量数据库、知识图谱。它们详细阐述了如何在不同的粒度(文档、组块、句子、图结构)和优化时间(无训练、联合预训练、SFT等)下组织记忆。智能体记忆/前额皮层探索自主智能体如何维持短期记忆(CoT++)与长期记忆(外部事实数据库、历史轨迹、用户反馈等)。我非常喜欢这个关于记忆的思考框架,但我认为除了分类之外,这项调查最大的贡献在于指出了尚未解决的问题:记忆污染/幻觉、大规模检索的计算负担、何时应该检索信息而不是依赖参数化知识,以及长时间交互过程中记忆一致性的挑战#科技先锋官##ai生活指南##ai创造营#

31. 幻觉率不到3%,王小川把医生版的DeepSeek免费了

32. AI开发常常需要切换多个资源库,查文档学Oracle AI Database、找Notebook实验代理系统、看教程建RAG应用,来回折腾效率低下。Oracle AI Developer Hub 把AI开发所需资源全整合,提供完整的Oracle AI Database + OCI服务开发解决方案。包含完整应用demo、Jupyter Notebook、动手workshop、代理记忆包,甚至企业级AI代理架构指南。GitHub:github.com/oracle-devrel/oracle-ai-developer-hub主要功能:- 完整AI应用demo(/apps),展示端到端RAG代理、金融AI助手、健身追踪器等实战案例;- 丰富Jupyter Notebook(/notebooks),覆盖RAG、多代理CoT、混合搜索、11种认知架构实验;- 动手workshop(/workshops),从信息检索到记忆增强代理的全栈学习路径;- Oracle AI Agent Memory包,支持统一内存核心(对话历史、持久事实、实体状态);- 详细指南(/guides),企业AI代理大脑/骨架构建、记忆工程学科深度解析;- 多云支持,AWS/Azure/Google Cloud + Oracle AI Database集成样例。支持Jupyter、Python、FastAPI、LangChain等多框架,Codespaces一键环境,适合AI工程师和开发者使用。#OracleAI##AI开发##RAG代理#

33. 《扣子开发 AI Agent 智能体应用》014-基于大模型的企业知识库(知识库的理论基础 RAG)

34. 面试常问的RAG文本向量检索不准怎么办?

35. 深夜调试 RAG 系统后,我总结了这 5 个让检索准确率翻倍的核心技巧

36. 腾讯面试官

37. 《检索优化

38. AI Agent 实战避坑 07|RAG 不是接个向量库就完事

39. RAG系统效果调优终极指南

40. RAG不再困难

41. 为什么你的RAG准确率只有40%?

42. RAG做不好?效果差?99%的人都是检索没做好!

43. RAG准确率提升方案

44. 京东大模型二面

45. RAG检索系统优化实战

46. 携程大模型二面

47. 面试官问了我一个RAG问题,我哑口无言

48. RAG翻车实录

49. 向量数据库与图数据库在RAG中的对比

50. 一文讲清楚RAG优化

51. RAG进阶篇 | 混合检索+重排序=王炸!

52. 向量检索不是 RAG 的唯一路径

53. RAG 的“时间盲区”

54. 你的 RAG 做错了

55. 图谱RAG

56. 淘天大模型三面

57. rag检索怎么做?首先要做多路召回,单路召回容易出现幻觉。

58. 图解 RAG(十)快速入门|反思技术

59. RAG中的查询重写 (Query Rewriting) 是什么?

60. 大模型 + RAG 幻觉治理方案总结

61. RAG幻觉(Hallucination)

62. 面试官问

63. RAG优化技术

64. 在 RAG 架构设计中,如何选择向量大模型(Embedding Model)?

65. 多语言 RAG 的上下文被卡在 512 太久了

66. 论文解读

67. 三、如何上手 RAG?

68. 告别“一本正经地胡说八道”

69. RAG知识库从0到1

70. 企业知识库 RAG 落地

71. 为RAG选择正确的嵌入模型

72. RAG

73. RAG工程化实践方法论 - 父子索引

74. 图解 RAG(七)快速入门|高级索引

75. 从零构建企业级RAG知识库系统|全链路架构拆解与落地最佳实践

76. RAG中的四类索引,你都搞清楚了吗?

77. RAG系列·第4篇

78. Embedding 决定你能找到什么,Reranker 决定你最终拿到什么

79. 从零开始agentic RAG

80. RAG检索精度从70%到92%,我只加了这一个组

81. 阿里面试官

82. RAG大厂面试题汇总

83. RAG的优化怎么做更好

84. 动态知识库的RAG系统混合检索与性能优化研究

85. RAG 检索全攻略

86. RAG 的检索模块是怎么优化的?

87. RAG检索终极指南

88. 为什么说纯向量检索在 RAG 中是不够的?混合检索与 RRF 算法全解析

89. 我做了一个能落地的企业级 RAG

90. 轻量高效、CPU 友好!JiaJia‑Search 混合检索引擎,赋能工厂智能问答 Web 系统落地

91. B04「RAG 效果调优」这 5 个参数决定了你的知识库好不好用

92. 第15课

93. Hermes + RAG本地知识库保姆级教程——5分钟搭建私有知识库

94. 智能客服实战

95. 政企知识库为什么总是“搜不准”?RAG管线调优全指南

96. RAG调优实战(二)驱逐“噪音”,拉升准确率的3大硬核优化

97. 图解 RAG(六)快速入门|检索策略

98. 上下文检索

99. Agentic RAG & Agent 记忆系统

100. RAG 核心技术

101. RAG 效果差,80% 的问题和模型无关

102. 大家觉得做一个大模型检索增强生成(RAG)系统,最难搞定的是那部分工作?

103. 如何有效提升RAG效果(三)

104. 整理了一套可落地的RAG分片验证指标体系给到大家

105. 企业RAG落地踩的7个坑

106. RAG 落地手记一

107. RAG知识库完整实战手册

108. 群英论“数”|RAG知识问答系统落地方案

109. 今天来学习 RAG 技术

110. RAG 技术深度解析

111. RAG召回准确率从75到90 我做对了这三件事

112. RAG实战——我的Wiki系统准确率从60%提升到95%

113. 从80%到90%

114. 我用7层架构重写RAG后准确率从40%飙到92%|你的RAG为什么是垃圾(纯享版)

115. 东南大学研究团队—RAG 赋能路面养护

116. 蚂蚁大模型三面

117. 大厂P7

118. RAG不再困难

119. 提升 RAG 准确率的 5 种方案!

120. 2026年构建RAG系统的核心策略

121. RAG 陷阱:向量搜索不是语义理解

122. 解决RAG检索“失准”难题:宝兰德DeBot的检索优化实践

123. 图解 RAG(五)快速入门|查询优化:Multi Query、RAG-Fusion 与 HyDE

124. SkillRAG:Skill的风又把RAG吹活了~

125. Agentic RAG 2026: 企业落地指南

126. 一文搞懂RAG-从索引构建到检索生成的完整技术原理

127. RAG检索又失败了?Skill-RAG让RAG学会对症下药

128. RAG优化技术:HyDE——用“假设生成”破解检索语义鸿沟

129. RAG:混合检索

130. RAG知识库构建策略

131. BGE Reranker vs Qwen3-Reranker:小落同学的 Reranker 选型

132. RAG系统如何检索知识?

133. 告别切块与向量数据库:用 PageIndex 构建新一代 Agentic RAG

134. 🥕构建复杂RAG 系统所需组件及优化方法介绍

135. 小米大模型二面:RAG 检索不到问题时如何定位问题?排查思路是什么?

136. 为什么纯向量检索,做不好企业级RAG?

137. 基于 Milvus 构建企业级 RAG 问答系统:从原理到实践

138. 知识图谱如何为RAG注入“灵魂”,打造极致智能客服

139. RAG+生成式检索:AI幻觉的终结者?

140. RouteRAG:用特殊 Token 和强化学习构建可学习的 RAG 检索策略

141. Reranker 模型选型:为什么 Qwen3-Reranker 碾压同类

142. 让RAG像人类一样“扫视全文”:上下文检索技术详解

143. 大模型面试02: RAG“语义漂移”

144. 2026多模态RAG实战:微调嵌入与重排序模型,构建真正的视觉语义搜索

145. 【前沿速递】12 种 RAG(检索增强生成)的新型高级架构与方法

146. Embedding + Reranker:中文场景下的最优实践

147. AI实战篇:RAG评估从0到1落地,让你的检索增强生成系统能量化、能优化

148. RAG模型选型

149. 使用 BGE-Reranker-v2-M3 实现文本精排 - 哔哩哔哩

150. 详谈Advanced RAG:预检索优化之摘要索引

151. RAG效果不理想,怎么优化?Recall太低,是Milvus的问题吗?

152. Skill-RAG:RAG检索失败不是多检索几次就能搞定的

153. 不用向量检索了,让AI像翻目录一样找企业

154. 知识库准确率只剩40%?你的坑不是RAG本身,是工程

155. PageIndex向量无依赖RAG系统:树状索引破解长文档检索困局

156. 解决跨文档RAG三大痛点!性能超RAPTOR 25.9%的新型树索引RAG框架 【大语言模型】【检索增强生成】

157. Ollama嵌入模型选型指南-主流模型深度对比

158. RAG召回率太低怎么解决?

159. RAG系统 80% 准确率,这3个坑太绝望

160. 大模型RAG架构中语义理解与语义检索的区别与联系,一文读懂核心差异!

161. 007:RAG 入门-向量嵌入与检索

162. RAG 特效药:高效提高你的 RAG 准确率

163. RAG系统的6个幻觉问题+4个缓解阶段策略

164. 砖家说AI-RAG 检索增强生成:让 AI 从"胡编"到"真懂"

165. 一文讲清:RAG中语义理解和语义检索的区别到底是什么?有何应用?

166. [ACL26] RAG很“脆弱”?文档顺序敏感问题

167. 从零开始agentic RAG:3.语义切片 + Ragas 评估体系

168. Rag与Agent 性能调优50 讲 - 哔哩哔哩

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章