RAG才是解决大模型“失忆症”的正确姿势:选错方案等于白搭

源自141位全网作者

04-11 18:40

精选参考来源

1
通俗易懂的解释 LLM,RAG 和 AI Agent 的差别,以下内容为原推的翻译:我终于明白了LLM、RAG和AI智能体的区别过去两年里,我一直在搭建真正落地的AI系统。现在,我终于清楚了:LLM(大语言模型)、RAG(检索增强生成)和AI智能体(AI Agents),根本不是互相竞争的技术,而是构成同一个AI智能系统的三个层次。很多人用错了方法,把它们当成互斥的工具。---> 大语言模型是“大脑” <LLM 就像AI的脑子,它会思考,会写作,也懂语言。但问题来了:它是冻结在某个时间点的。比如 GPT-4,它的知识截止到训练结束的那一天。你问它昨天的新闻发生了什么?那可就瞎编了。大语言模型很聪明,但却不了解“现在”正在发生的事。---> RAG是AI的“记忆” <这时候就需要 RAG(Retrieval-Augmented Generation,检索增强生成)了,它相当于给大脑接入了“外置内存”。当你提问时,RAG会先去外部数据库或文档里搜索,把相关资料抓出来,再丢给大语言模型作为上下文。这样一来,原本静态的模型一下子就“活”了:- 有最新的数据- 有真实的事实- 完全不需要重新训练模型最关键的是,准确率立刻就提高了。大语言模型不用再靠记忆乱猜,而是真正地在实时检索到的信息上进行推理。你甚至还能追溯每个答案到底用了哪些文档。---## > AI智能体是AI的“行动力” <尽管LLM能思考,RAG能提供新鲜的数据,但它们都缺乏真正的行动能力。这时,AI智能体(AI Agents)出场了。它在大语言模型的外面套上了一个控制循环:- 设定目标- 规划步骤- 执行行动- 回顾反思AI智能体并不仅仅是回答问题那么简单,它能自主地去研究一个话题、收集数据、撰写报告,甚至帮你发邮件,全程自动化。---> 真正的生产级AI,要同时用好这三者 <很多酷炫的AI展示,其实只是单纯用了LLM再配上花里胡哨的提示词。但真正能落地的AI系统,往往同时结合了这三个要素:- LLM 提供推理和思考能力- RAG 确保知识准确而新鲜- AI智能体 则提供行动和决策能力---> 如何选用这三者? <- 只用LLM 如果你需要纯语言的任务,比如写作、摘要、解释。- LLM + RAG 如果你需要回答涉及特定文档、技术手册、专业领域知识的问题,并确保答案准确无误。- LLM + RAG + AI 智能体 如果你需要真正的自主行动,比如系统自己决策、执行任务、管理复杂流程。---> AI的未来,不是选哪一种,而是如何把这三层架构起来 <记住这个公式:- LLM负责思考- RAG负责知识- AI智能体负责行动真正的AI智能系统,就是这三者协同起来,形成一个完整的智能架构。来源:x.com/connordavis_ai/status/1985663551697273216
2
在线开发智能代理系统遇到上下文管理难题?推荐看看 muratcankoylan 的开源项目「Agent Skills for Context Engineering」,这是一个面向生产级 AI 代理系统的全面技能库。它提供了完整的上下文工程方案,涵盖基础理解、架构设计、多代理协作、工具开发、评估优化等多维度技能,帮助你科学管理语言模型的上下文窗,实现最高效的上下文利用和智能决策。主要亮点:- 深入讲解上下文衰减、压缩和优化,避免模型“迷失中间”;- 支持多代理架构设计,含监督者模式、图谱记忆、沙盒环境等;- 提供完善的评估框架,支持LLM作为裁判进行性能对比和偏差缓解;- 包含项目开发全流程指导,从概念设计到流水线部署;- 独家认知架构技能,形式化建模代理心智状态,实现理性推理与解释;- 跨平台、通用原则,适配Claude Code、Cursor等主流代理平台。GitHub:github.com/muratcankoylan/Agent-Skills-for-Context-Engineering无论你是搭建单一代理还是多智能体系统,这套技能库都能助你构建、优化和调试高效智能体,推荐 AI 开发者和研究者深入学习!#AI创造营##人工智能#
全部
来源
内容由AI生成

精选参考来源

1. 通俗易懂的解释 LLM,RAG 和 AI Agent 的差别,以下内容为原推的翻译:我终于明白了LLM、RAG和AI智能体的区别过去两年里,我一直在搭建真正落地的AI系统。现在,我终于清楚了:LLM(大语言模型)、RAG(检索增强生成)和AI智能体(AI Agents),根本不是互相竞争的技术,而是构成同一个AI智能系统的三个层次。很多人用错了方法,把它们当成互斥的工具。---> 大语言模型是“大脑” <LLM 就像AI的脑子,它会思考,会写作,也懂语言。但问题来了:它是冻结在某个时间点的。比如 GPT-4,它的知识截止到训练结束的那一天。你问它昨天的新闻发生了什么?那可就瞎编了。大语言模型很聪明,但却不了解“现在”正在发生的事。---> RAG是AI的“记忆” <这时候就需要 RAG(Retrieval-Augmented Generation,检索增强生成)了,它相当于给大脑接入了“外置内存”。当你提问时,RAG会先去外部数据库或文档里搜索,把相关资料抓出来,再丢给大语言模型作为上下文。这样一来,原本静态的模型一下子就“活”了:- 有最新的数据- 有真实的事实- 完全不需要重新训练模型最关键的是,准确率立刻就提高了。大语言模型不用再靠记忆乱猜,而是真正地在实时检索到的信息上进行推理。你甚至还能追溯每个答案到底用了哪些文档。---## > AI智能体是AI的“行动力” <尽管LLM能思考,RAG能提供新鲜的数据,但它们都缺乏真正的行动能力。这时,AI智能体(AI Agents)出场了。它在大语言模型的外面套上了一个控制循环:- 设定目标- 规划步骤- 执行行动- 回顾反思AI智能体并不仅仅是回答问题那么简单,它能自主地去研究一个话题、收集数据、撰写报告,甚至帮你发邮件,全程自动化。---> 真正的生产级AI,要同时用好这三者 <很多酷炫的AI展示,其实只是单纯用了LLM再配上花里胡哨的提示词。但真正能落地的AI系统,往往同时结合了这三个要素:- LLM 提供推理和思考能力- RAG 确保知识准确而新鲜- AI智能体 则提供行动和决策能力---> 如何选用这三者? <- 只用LLM 如果你需要纯语言的任务,比如写作、摘要、解释。- LLM + RAG 如果你需要回答涉及特定文档、技术手册、专业领域知识的问题,并确保答案准确无误。- LLM + RAG + AI 智能体 如果你需要真正的自主行动,比如系统自己决策、执行任务、管理复杂流程。---> AI的未来,不是选哪一种,而是如何把这三层架构起来 <记住这个公式:- LLM负责思考- RAG负责知识- AI智能体负责行动真正的AI智能系统,就是这三者协同起来,形成一个完整的智能架构。来源:x.com/connordavis_ai/status/1985663551697273216

2. 在线开发智能代理系统遇到上下文管理难题?推荐看看 muratcankoylan 的开源项目「Agent Skills for Context Engineering」,这是一个面向生产级 AI 代理系统的全面技能库。它提供了完整的上下文工程方案,涵盖基础理解、架构设计、多代理协作、工具开发、评估优化等多维度技能,帮助你科学管理语言模型的上下文窗,实现最高效的上下文利用和智能决策。主要亮点:- 深入讲解上下文衰减、压缩和优化,避免模型“迷失中间”;- 支持多代理架构设计,含监督者模式、图谱记忆、沙盒环境等;- 提供完善的评估框架,支持LLM作为裁判进行性能对比和偏差缓解;- 包含项目开发全流程指导,从概念设计到流水线部署;- 独家认知架构技能,形式化建模代理心智状态,实现理性推理与解释;- 跨平台、通用原则,适配Claude Code、Cursor等主流代理平台。GitHub:github.com/muratcankoylan/Agent-Skills-for-Context-Engineering无论你是搭建单一代理还是多智能体系统,这套技能库都能助你构建、优化和调试高效智能体,推荐 AI 开发者和研究者深入学习!#AI创造营##人工智能#

3. 开发者在使用 Claude Code 编写代码时,想要自动保存每次操作的上下文和工具使用情况,方便后续继续工作。Claude-Mem 是一款为 Claude Code 打造的持久化记忆压缩插件,能抓取工具执行的观察数据,通过 AI 进行语义压缩,并将相关上下文注入到未来的编码会话中。它支持跨会话保持上下文连贯,内置智能搜索功能,能用自然语言查询历史操作,极大提升项目管理和代码回溯的效率。插件提供 Web UI 实时查看记忆流,并可配置隐私标签过滤敏感信息。更有实验性的“无限模式”,通过压缩和分层存储实现更长的会话记忆,适合复杂项目的持续开发。主要功能:- 自动捕获并压缩会话数据,实现跨会话记忆延续- 语义搜索工具,快速定位历史决策和代码修改- Web 界面实时展示记忆流和搜索结果- 灵活配置隐私控制和上下文注入策略- 支持实验性无限扩展会话长度的“Endless Mode”- 基于 SQLite 和向量数据库结合实现高效存储和检索适用于需要在多次编码会话中保持项目上下文连续的开发者,尤其是使用 Claude Code 进行 AI 辅助编程的用户。项目地址:github.com/thedotmack/claude-mem安装简单,启动后自动生效,无需手动操作。想让 AI 更懂你的代码历史,这个开源插件值得一试。

4. 《REFRAG: Rethinking RAG based Decoding》Meta最新发布的REFRAG技术,彻底解决了检索增强生成模型(RAG)最大的瓶颈:解码效率低下。相比传统RAG,REFRAG实现了30倍更快的首词生成速度,同时保持零准确率损失。问题核心在于:RAG在输入大量检索段落时,实际只有5-10段内容对生成有用,剩余多数成为计算负担,但模型仍对所有段落进行全面注意力计算,导致时间和内存资源巨大浪费。传统RAG用16K上下文时,首次输出延迟超过100秒,吞吐量下降10倍,内存消耗爆表。REFRAG通过将上下文块压缩成单一嵌入向量,避免了对全部16,384个token的逐一处理,仅需处理约1,024个压缩块嵌入,极大减少计算量。成果显著:- 首词生成速度提升30.85倍- 语义困惑度(perplexity)无损失- 上下文容量扩展16倍(4K token → 64K token)- 性能超越前沿技术3.75倍为何行得通?因为RAG的注意力模式稀疏,大多数检索段落间无交互。REFRAG通过以下三点巧妙利用这一点:1. 预计算并缓存嵌入,推理时重复使用2. 基于强化学习的压缩策略,智能决定哪些块需展开3. 不受位置限制,任意位置均可压缩实际应用优势:- 仅8段文本的延迟即可达到单段处理速度- 在检索器性能较弱时,依然提升准确率- 可支持无限长会话历史- 无需修改基础模型架构这项技术改变了RAG的计算经济学:更多上下文、更低延迟,且成本更优。REFRAG不仅是性能优化,更是RAG从“功能”向“基础设施”转型的关键一步。它告诉我们,提升AI系统效率的关键不在于盲目增加计算资源,而是精准减少无效计算,压缩信息冗余,从根本上优化流程。更多细节和论文链接见:arxiv.org/abs/2509.01092这背后,技术创新带来的不仅是速度,更是未来大规模长文本理解与生成的基石。希望更多开发者和研究者能从中得到启发,推动RAG技术应用迈入新阶段。

5. RAG、LangChain、Agent 到底有什么关系?

6. 网页链接langchain发了篇官博,探讨了智能体如何利用文件系统进行上下文工程,以提升其性能和可靠性。智能体失败的主要原因并非模型能力不足,而是缺乏正确的上下文信息。上下文工程的目标是精准地将必要信息填入模型的上下文窗口,避免信息缺失、冗余或不相关。常见的上下文工程挑战包括: 信息过多(检索内容远超所需):如网络搜索返回大量无用内容,浪费token并增加成本。 信息过少或超出上下文窗口:复杂任务需大量信息,单次无法加载全部。 难以定位小众信息:所需信息埋藏在大量文件中,语义搜索效果有限。 缺乏持续学习能力:无法从交互中积累新知识。文件系统是解决这些问题的关键工具,其优势体现在: 作为“草稿板”:将大体积工具输出(如网页内容)存入文件系统,按需通过grep等工具提取关键信息,减少上下文占用。 动态管理上下文:存储长期计划、子任务结果或复杂指令,按需调用,避免系统提示过载。 精准搜索:利用ls、glob、grep等命令在结构化目录中快速定位特定文件、行甚至字符,尤其适合代码或技术文档。 持续学习与自我更新:智能体可通过用户反馈更新自身“技能文件”,将新知识写入文件系统,实现长期记忆与能力进化。#科技先锋官#

7. 大型语言模型(LLM)已成为解决多样化任务的强大工具,企业纷纷投入应用。然而,从演示和原型迈向成熟产品,仍面临诸多挑战。新书《Designing Large Language Model Applications》由资深机器学习研究员Suhas Pai撰写,系统分享了构建实用LLM应用的关键方法与实战经验。书中深入解析了语言模型的核心组成,详细介绍了微调、领域适配、检索增强生成(RAG)、智能代理等多种应用范式。读者将学会如何准备训练数据、理解Transformer架构及其变体,掌握高效微调与推理优化技巧,进而将预训练模型无缝集成到企业现有软件生态中。这本书不仅填补了从理论到实践的鸿沟,更为开发者提供了应对常见模型失效的策略,助力打造更智能、更可靠的语言模型应用。对于希望深入理解并充分利用LLM潜力的技术人员和产品经理,这是一部不可多得的指南。链接:www.oreilly.com/library/view/designing-large-language/9781098150495/

8. 刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

9. 随着 Karpathy 分享的 LLM 知识库工作流走红,大家都在折腾 RAG 和 Agent。其实 Google 的 NotebookLM 已经是个现成的专业分析器,几分钟就能把一个 YouTube 频道变成你的私人知识库。以分析 Peter Attia 的播客为例,我的以下流程完全不需要安装第三方工具,操作极简:1. 访问: Chrome 打开 YouTube 频道的 Video 页面。2. 一行代码: 打开 Chrome DevTools (F12) -> Console,同时 youtube 手工滚动往下面多加载一些视频,然后输入以下代码到 console 获取所有视频 URL:// 获取当前页面所有视频链接的代码var urls = Array.from(document.querySelectorAll('a#video-title-link')).map(a => a.href);console.log(urls.join('\n'));3. 导入 Source: 新建 Notebook -> Add Source -> Website,批量粘贴 URL,注意单个 notebook 最大 50 个4. 即时对话: 导入后,你就可以直接基于知识库提问:“根据 Peter 的理论,我该如何设计训练计划?”,效果见图2。优势: 不用折腾 Token 成本,不用调优 Embedding,NotebookLM 访问 Google 内部资源比如 youtube 视频尤其有优势。

10. 给大家推荐一个不错的开源项目 Hello-Agents,是一套从零开始学习构建智能体的免费教程。内容覆盖得比较全面。基础部分讲了大模型和 Agent 的核心概念,实战部分手把手带你实现 ReAct、Plan-and-Solve、Reflection 这些开发模式。如果你更习惯用低代码平台,教程里也有 Coze、Dify、n8n 的实操内容。框架方面涉及 Python 生态里常用的 AutoGen、AgentScope、LangGraph,项目本身还从零搭建了一个 HelloAgents 框架。除此之外,记忆机制、RAG、MCP、评估方法这些也都有涉及,案例挺多的,还整理了面试相关的题目和代码。唯一的小遗憾是代码都是 Python 写的。顺便说一句,这个项目来自 datawhalechina 组织,他们那里还有不少其他 AI 相关的教程资源,感兴趣可以去看看。开源项目地址:github.com/datawhalechina/hello-agents#科技先锋官##微博兴趣创作计划##AI创造营#

11. 从RAG到记忆工程:AI长期记忆系统的架构范式与落地瓶颈

12. 《扣子开发 AI Agent 智能体应用》014-基于大模型的企业知识库(知识库的理论基础 RAG)

13. Claude 1M正式上线,价格一分不涨,搭了半年RAG的人崩了。。。

14. 如何系统性的学习RAG、Agent、MCP?

15. Leonie Monigatti深入剖析了AI代理中的记忆演进,从最初的RAG(检索增强生成)到Agentic RAG,再到具备读写能力的Agent Memory,厘清了这一系列技术的核心逻辑与突破。RAG诞生于2020年,其核心是将离线存储的外部知识检索进LLM上下文,解决模型记忆有限带来的问题。但其“单次检索”与“只读”限制导致复杂场景下仍有误导风险。Agentic RAG引入了“工具调用”机制,允许智能体主动判断是否需要检索、选择检索工具,并评估检索结果相关性,显著提升了灵活性和准确性,但仍无法动态学习和更新信息。Agent Memory则迈出关键一步:支持智能体不仅读取,还能写入和管理外部记忆,实现基于历史交互的持续学习和个性化体验。它将记忆从“静态”转变为“动态”,但也带来了记忆管理和遗忘机制的新挑战。这三者共同体现了信息“存储-检索-编辑-删除”的完整闭环,也反映了AI系统从单点知识调用向复杂记忆体系演进的趋势。未来,如何设计高效的多源、多类型记忆管理策略,将是提升AI智能和人机交互体验的关键。详细内容及代码示例请见原文:leoniemonigatti.com/blog/from-rag-to-agent-memory.html

16. 这个《Context Engineering》还挺全面的,讲述了如何构建完整智能系统的综合指南。包括如何通过AI Agent、RAG、记忆系统和工具集成等核心技术,来解决LLM与外部数据、历史和现实世界相隔离的根本问题。其核心观点是,打造卓越AI应用的关键,在于系统性地设计和管理模型获取信息的方式,可以让你对AI系统有个全貌,从一个简单的“提示者”转变为一个智能系统的“架构师”。 #ai创造营##程序员#

17. LLM,RAG和Agent不是割裂的,而是一个整体。如果把 AI 系统比作一个生命体,那么 LLM = 大脑,RAG = 记忆,Agent = 执行系统。LLM 像是大脑的皮层,擅长理解、联想和表达。它能在复杂的语言世界中“即兴发挥”,像人类一样推理、总结、编故事。也会在需要时做出“认知上的决策”——比如分析问题的思路、选择回答的方向。然而,大脑并不擅长记住具体事实。它能推断“苹果会掉下来”,却未必记得“牛顿是什么时候发现的万有引力”。这时,就需要「RAG」登场。RAG 相当于一个“外接记忆系统”。当大脑想不起细节时,它能立刻翻查资料库,把相关的事实、文档、图像调出来,再交还给大脑整合成一段有根据的回答。于是,大脑不再是“瞎编”,而是“有据可依”。从技术上讲,这就像给模型装上一个搜索引擎——但比搜索更聪明,因为它能理解上下文、筛选关键信息、甚至融合多个来源的内容。Agent 则像是神经系统中的“执行层”。大脑想出了计划,记忆提供了依据,而真正“去行动”的,是 Agent。它决定什么时候要产生计划,要不要调用工具、查阅资料、生成报告,甚至与外部世界互动。可以说,LLM 负责“想”,RAG 负责“记”,Agent 负责“做”。当这三者协同工作时,AI 便不再是一个“聊天机器人”,而是一个有意识、有记忆、有行动能力的“数字生命”。#ai创造营##科技#

18. 在构建RAG Agent时,哪些场景应该用确定性逻辑判断取代LLM的概率推理,具体怎么实现?

19. 《MCP协议与AI Agent开发》007-MCP的基本原理(MCP上下文结构与层级划分)

20. 做了个RAG评估小框架开源做RAG时发现,麻烦的往往是数据处理到评估的那条流水线。所以顺手写了个工具,用中文数据集做基准,内置标准流程,方便快速试不同的检索和生成方案平时主要用它两件事,一是快速验证新想法,不用重复写脚本,二是在同一套指标下对比不同策略,看问题出在哪#rag#

21. MemPalace:好莱坞女星米拉·乔沃维奇携手开发者推出开源AI记忆工具,基准测试夺冠 知名演员米拉·乔沃维奇(Milla Jovovich)与工程师Ben Sigman共同开发了一款全新的开源AI记忆工具——MemPalace,并于近日正式宣布发布。该工具采用“记忆宫殿”(Memory Palace)架构,灵感来源于古老的记忆术,能为AI代理(agent)提供持久、结构化的长期记忆。开发者表示,MemPalace完全本地运行,无需任何外部API或付费服务,用户可免费在GitHub上获取并使用。#人工智能# 据项目公布的数据,MemPalace在行业标准基准测试LongMemEval上取得亮眼成绩:原始召回率达96.6%,通过轻量级重排序后可达到100%,超越目前所有已发布的免费或付费AI记忆工具(如Mem0、Zep等)。 不同于传统方案依赖AI自动总结和遗忘,MemPalace采用无损压缩技术,完整保留对话原文,并以虚拟“宫殿”中的房间、抽屉等结构进行组织,从而显著提升AI在长上下文场景下的记忆与检索能力。 Ben Sigman在社交媒体上兴奋地表示:“我们非常高兴能与好友米拉共同开发这款免费开源工具,它已在GitHub上线。” 米拉·乔沃维奇也在Instagram发布视频介绍项目理念,并鼓励开发者试用、反馈、Fork或贡献代码。目前项目已迅速获得数千星标,并开设了Discord社区供用户交流。开发者欢迎全球AI爱好者参与共建,推动AI记忆技术的进一步发展。

22. 【AI记忆系统突破99%准确率:用Agent完全替代向量数据库】快速阅读: Supermemory团队用多智能体协作系统在长期记忆基准测试LongMemEval上达到99%准确率,核心突破是用3个并行搜索Agent替代传统向量检索,让AI通过“理解”而非“数学相似度”来回忆信息。这套方案不需要向量数据库,甚至可以嵌入机器人。---向量数据库可能不是AI记忆的最优解。Supermemory在LongMemEval基准测试(11.5万token对话历史)上达到99%准确率,用的方法反而更简单:完全抛弃向量检索,改用多个Agent协作。传统RAG的问题出在检索环节。语义相似度匹配根本分不清“旧事实”和“新更正”,当检索结果里混杂太多噪音,大模型就会迷失。他们的解法是ASMR(Agentic Search and Memory Retrieval):信息摄取阶段,3个并行Observer Agent同时读取对话记录,按照个人信息、偏好、事件、时间数据等六个维度提取知识点,直接存储结构化内容而非生成embedding。检索阶段才是关键。面对提问时不查询数据库,而是派出3个专门的搜索Agent——一个找直接事实,一个挖隐含语境,一个重建时间线。这些Agent是在“主动阅读和推理”,不是在做向量余弦计算。回答阶段用了两种策略测试。第一种是8个高度专业化的prompt变体并行运行(精确计数专家、时间专家、上下文深挖专家等),只要任何一条推理路径答对就算成功,准确率98.6%。第二种是12个Agent独立作答后,由一个聚合器LLM综合投票裁决,准确率97.2%。有观点认为这套系统证明了“认知理解”比“数学相似性”更适合处理记忆任务。数学只能捕捉表层模式,而Agent可以处理时间序列中的矛盾、更新和细微差别。更有意思的是,这个架构完全在内存中运行,不依赖外部向量数据库,理论上可以部署到任何设备,包括机器人。他们11天后会开源全部代码。当数十亿个高度个性化的AI Agent开始学习和记住我们的一切时,记忆系统的天花板在哪里?也许不在算力,而在我们愿意给Agent多少“主动思考”的权限。ref: x.com/DhravyaShah/status/2035517012647272689#AI创造营##人工智能#

23. 1688 生成式检索的探索与业务落地

24. Milvus 向量数据库实战:从零构建高性能 RAG 系统

25. 9个最佳的Claude Code提效项目1. Superpowers网页链接Superpowers是Claude Code的增强插件,提供快速原型开发和迭代编码能力。2. Awesome Claude Code网页链接精选的Claude Code资源、技巧、提示词、工具和集成的完整列表。3. GSD (Get Shit Done)网页链接轻量级任务自动化框架,帮助Claude Code高效完成日常开发工作流程。4. Claude Mem网页链接为Claude Code添加持久化内存能力,自动跨会话保存上下文,减少重复信息输入。5. UI UX Pro Max网页链接AI驱动的设计系统生成器,根据产品类型自动推荐配色、排版、布局和组件模式。6. n8n-MCP网页链接为Claude提供n8n自动化工作流的完整文档和API访问,让Claude能设计和部署复杂的自动化。7. Obsidian Skills网页链接Obsidian笔记软件的Agent Skills,使Claude Code能直接创建和编辑Markdown、Canvas和Bases。8. LightRAG网页链接轻量级检索增强生成框架,通过知识图谱和向量检索为Claude Code提供更精准的信息检索。9. Everything Claude Code网页链接production级Agent框架,包含28个专业子Agent、116个技能、59个命令和完整的安全审计系统。#HOW I AI# #程序员# (via. Hasan Toor)

26. GitNexus 是一个把代码库自动转成“知识图谱”的工具,并在此基础上提供 Graph-RAG 与 AI 对话能力,用于让人和 AI 更快理解大型代码库。特点:零服务器、浏览器本地运行、隐私优先。核心能力:1、代码 → 知识图谱项目通过 AST 分析构建图结构。这套流程采用四阶段分析:1)结构扫描2)AST 解析3)依赖解析4)调用图构建最终得到完整代码图。2、Graph-RAG 代码问答与传统 RAG 不同,GitNexus 的检索是图查询。AI 通过 Cypher 查询或图遍历获取上下文,比 embedding 检索更精确。3、零服务器隐私架构项目最突出的设计之一:1)所有分析在浏览器本地运行2)代码不上传服务器3)数据库为 WASM 版图数据库4)API key 本地保存适合企业代码安全场景。4、面向 AI Agent 的设计GitNexus 不只是可视化工具,而是 Agent 基础设施。它能提供:1)影响范围分析2)依赖追踪3)架构检查4)自动化审计目标是让 AI 编程助手具备“架构感知能力”。项目:github.com/abhigyanpatwari/GitNexus#HOW I AI# #程序员# 黄建同学的微博视频

27. RAG退潮,“文件系统+grep”回归,智能体检索的返璞归真

28. 智能体上下文工程:为什么文件系统成了AI记忆的最佳载体?

29. 《I Reverse Engineered ChatGPT's Memory System, and Here's What I Found!》 我逆向拆解了ChatGPT的记忆系统,发现它远比想象中简单高效。它没有用复杂的向量数据库,也没有传统的基于检索增强生成(RAG)机制,而是采用了四层结构: 1. 会话元数据(Session Metadata):每次对话开始时注入,包含设备类型、浏览器信息、地理位置、订阅等级、使用习惯等。这些信息实时适配你的环境,但不会永久保存。 2. 用户记忆(User Memory):长期存储明确的用户事实,如姓名、职业目标、兴趣爱好等。这些信息由用户明确添加或模型自动识别确认,并在所有后续对话中持续注入。 3. 最近对话摘要(Recent Conversations Summary):用轻量级的摘要记录近期用户的消息片段,约15条,帮助模型跨会话保持兴趣的连续性,而非检索完整历史,极大降低了延迟和计算成本。 4. 当前会话消息(Current Session Messages):滑动窗口式地保留当前对话的全部消息历史,确保对话的连贯性。基于token限制,旧消息会逐步被丢弃,但用户记忆和对话摘要始终保留。 这样分层协同,ChatGPT既能做到对用户“知根知底”,又避免了传统RAG系统中高昂的检索成本和复杂度。它牺牲了详细的历史上下文,换来了快速响应和高效个性化。 这背后的关键启示是:记忆不必是大而全的储存,而是动态的、分层的管理。会话元数据快速适应环境,显式记忆捕捉核心事实,摘要维系兴趣轨迹,当前消息保障即时理解。它们共同构建了一个“似乎真正了解你”的智能体。 对用户而言,ChatGPT可以随着使用越发贴合你的偏好和需求,无需复杂的知识库维护。对开发者,这是一堂务实的工程课:有时简单且精准的设计,胜过复杂难控的系统。 ChatGPT的记忆系统以平衡个性化、性能和token效率为目标,践行了“少即是多”的设计哲学。它记住重要的,而非全部,快速而灵活地陪伴你的每一次交流。 manthanguptaa.in/posts/chatgpt_memory/

30. 《扣子开发 AI Agent 智能体应用》013-基于大模型的企业知识库(企业知识库必要性)

31. 告别KV Cache枷锁,将长上下文压入权重,持续学习大模型有希望了?

32. Boris(Claude Code 创始人)解释为什么 Claude Code 不用 RAG 向量检索代码:在开发 Claude Code 的早期版本时,我们曾尝试过 RAG 搭配本地向量数据库的方案。但很快我们就发现,Agent 使用关键字搜索在实际应用中的表现通常要出色得多。这种方案不仅实现起来更加简洁,而且还完美避开了 RAG 模式下那些令人头疼的“老毛病”:比如数据安全性、隐私泄露风险、信息滞后以及系统可靠性等问题。

33. 字节火山开源的上下文数据库OpenViking, 专为 AI Agent 设计。该项目通过文件系统范式,统一管理智能体所需的记忆、资源与技能,解决了传统 RAG 架构中信息碎片化和检索低效的问题。1. 文件系统管理范式 → 解决碎片化问题:基于文件系统范式,将记忆、资源、技能进行统一上下文管理;2. 分层上下文按需加载 → 降低 Token 消耗:L0/L1/L2 三层结构,按需加载,大幅节省成本;3. 目录递归检索 → 提升检索效果:支持原生文件系统检索方式,融合目录定位与语义搜索,实现递归式精准上下文获取;4. 可视化检索轨迹 → 上下文可观测:支持可视化目录检索轨迹,让用户能够清晰观测问题根源并指导检索逻辑优化;5. 会话自动管理 → 上下文自迭代:自动压缩对话中的内容、资源引用、工具调用等信息,提取长期记忆,让 Agent 越用越聪明。项目:github.com/volcengine/OpenViking#HOW I AI# #过个有ai年#

34. AI Agent开发常常需要管理海量对话历史,传统RAG或知识图谱难以实现真正学习,记忆准确率低、长期遗忘严重。Hindsight™ 提供革命性的Agent记忆系统,让AI Agent真正"学会"而非仅"记住"。不仅在LongMemEval基准测试中创下最优性能,还支持世界事实、个人经历、心理模型构建,已被Fortune 500企业投入生产。GitHub:github.com/vectorize-io/hindsight主要功能:- 记忆保留(Retain):自动提取实体、关系、时序数据构建知识库;- 智能回忆(Recall):语义+关键词+图谱+时序四路并行检索;- 深度反思(Reflect):基于记忆生成洞察和决策建议;- 多用户记忆隔离:支持按用户/会话隔离记忆管理;- 生物仿生架构:模拟人类记忆机制(世界事实+经历+心理模型);- 一行代码集成:LLM Wrapper自动为现有Agent添加记忆能力。支持Docker一键部署、Python/Node.js客户端、嵌入式模式,兼容OpenAI/Anthropic等多种LLM提供商。#AIAgent##AgenticAI##人工智能#

35. OpenViking:一个非常实用的开源项目,专为AI Agent设计的上下文数据库,通过创新的“文件系统范式”统一管理Agent所需的记忆、资源和技能,彻底解决了传统向量数据库碎片化、检索效果差、上下文不可见的问题。主要亮点包括:- 文件系统管理范式,实现统一结构化管理,轻松浏览和操作上下文,像管理本地文件一样简单- L0/L1/L2三层上下文分级加载,按需调用,大幅降低Token消耗- 目录递归检索策略,结合目录位置和语义搜索,实现更精准、更全局的上下文获取- 可视化检索轨迹,完整呈现检索过程,方便调试和优化- 会话自动管理,自动提取长期记忆,Agent能“用得越久越聪明”支持Python包安装,也有Rust CLI工具;支持多家主流模型提供商,包含Volcengine、OpenAI、Anthropic、本地vLLM等等;同时提供详尽配置示例,轻松上手。新手快速开始示例脚本也非常简洁,几行代码即可增加资源、浏览文件结构、等待语义处理、抽取摘要、执行语义搜索,非常适合开发者验证和应用。同时官方推荐在云服务器(推荐Volcengine ECS + veLinux)环境中部署,保证稳定性和性能。如果你正打造智能Agent或者想优化上下文管理,强烈建议一试OpenViking,这个项目将让上下文管理和检索变得前所未有的清晰、高效、智能。GitHub地址:github.com/volcengine/OpenViking 官网:www.openviking.ai 文档:www.openviking.ai/docs

36. LightRAG 是一个简单快速的检索增强生成(RAG)框架,能高效整合大语言模型和知识图谱,实现智能文档查询和多模态检索。LightRAG支持多种存储方案(PostgreSQL、Neo4j、Milvus、OpenSearch等),支持文本、图片、表格、公式等多种数据类型的端到端知识抽取和问答。还提供了丰富的示例代码、Web UI,以及支持OpenAI、Hugging Face、Ollama、Azure OpenAI等多家模型接口。项目亮点:- 灵活配置的多存储架构,适合大规模知识管理;- 深度集成知识图谱构建与编辑,支持实体关系管理、知识图谱可视化;- 支持强大的Reranker提升检索效果;- 新增RAG-Anything,打通多模态文档处理与检索能力;- 丰富文档导入格式、引用功能、缓存管理、Token使用统计;- 还支持Langfuse可观测性监控以及RAGAS自动评价指标。无论是科研研究、企业知识库、还是多模态智能问答应用,LightRAG都提供了极具扩展性且高性能的解决方案。GitHub:github.com/HKUDS/LightRAG#在线智能检索# #知识图谱# #大语言模型# #RAG# #开源项目#

37. AI学会“科学交接班”,解决上下文难题——Anthropic智能(牛马)方法论

38. AI 的本质不是算力,而是「上下文革命」

39. 真钱买假模型?187篇论文被「套壳API」坑惨,准确率暴跌

40. github.com/Tencent/WeKnora 腾讯开源的RAG框架:WeKnora(维娜拉) 这是一款基于大语言模型的文档理解与语义检索框架,专为结构复杂、内容异构的文档场景而打造。 框架采用模块化架构,融合多模态预处理、语义向量索引、智能召回与大模型生成推理,构建起高效、可控的文档问答流程。核心检索流程基于 RAG(Retrieval-Augmented Generation) 机制,将上下文相关片段与语言模型结合,实现更高质量的语义回答。 核心特性 🤖 Agent模式:支持ReACT Agent模式,可调用内置工具检索知识库、MCP工具和网络搜索,通过多次迭代和反思给出全面总结报告 🔍 精准理解:支持 PDF、Word、图片等文档的结构化内容提取,统一构建语义视图 🧠 智能推理:借助大语言模型理解文档上下文与用户意图,支持精准问答与多轮对话 📚 多类型知识库:支持FAQ和文档两种类型知识库,支持文件夹导入、URL导入、标签管理和在线录入 🔧 灵活扩展:从解析、嵌入、召回到生成全流程解耦,便于灵活集成与定制扩展 ⚡ 高效检索:混合多种检索策略:关键词、向量、知识图谱,支持跨知识库检索 🌐 网络搜索:支持可扩展的网络搜索引擎,内置DuckDuckGo搜索引擎 🔌 MCP工具集成:支持通过MCP扩展Agent能力,内置uvx、npx启动工具,支持多种传输方式 ⚙️ 对话策略:支持配置Agent模型、普通模式模型、检索阈值和Prompt,精确控制多轮对话行为 🎯 简单易用:直观的Web界面与标准API,零技术门槛快速上手 🔒 安全可控:支持本地化与私有云部署,数据完全自主可控 #科技先锋官#

41. Agent 框架记忆问题的解法~用过 LangChain、CrewAI 这些 Agent 框架的都知道一个痛点:它们的记忆管理很鸡肋。大多数框架的做法是:短期放在列表里,长期靠 RAG 检索。听起来合理,实际很脆弱。问题在哪?1. 信息丢失。RAG 只会检索出片段,但对话的整体脉络、为什么重要、前后的因果关系都丢了。用户说"上次那个项目",Agent 可能查出相关文档,但根本不知道用户为什么关心这个项目。2. 幻觉加倍。Agent 基于零碎的检索结果推理,没有全局认知,自然容易编造细节。3. 记忆冲突。同一件事在不同时间表述可能不一样,Agent 也不知道哪个才是"真相",结果前后矛盾。核心问题:RAG 本质是"我记不全,就检索部分"——但这对需要全局一致性的 Agent 任务来说,根本不够。文章的解法:混合记忆架构,不是非此即彼,而是分层:第一层:实时记忆 —— 最近 N 轮对话完整保留,一个字都不丢。这保证了 Agent 对当前对话的理解是准确的。第二层:压缩记忆 —— 更早的对话不是直接存,而是压缩成摘要。比如 50 轮对话压缩成"5 个关键决定 + 3 个重要背景"。成本低,还保留了信息密度。第三层:语义检索 —— 用向量数据库索引压缩后的记忆。这样检索时找的是"高浓度摘要",而不是淹没在海量文档里。第四层:验证 —— 最关键的一步。Agent 每次从记忆里检索出来东西,要自己验证一下:"这个旧记忆和我现在的对话一致吗?"不盲目信任。为什么这个方案值得用?1. 解决了 RAG 的致命问题——记忆有连贯性,Agent 知道全局脉络,不再前后不一。2. 成本可控——压缩记忆大幅降低向量库规模和 token 消耗,相比把所有历史都存下来,省一个数量级的钱。3. 可验证——加验证层,Agent 不会死板地信任过期的记忆。适用场景:- 长期对话的 AI 助手(用户期望 Agent 真的"记得我们的历史")- 复杂多轮谈判或诊断(需要一致决策,不能前后矛盾)- 需要积累知识的任务流不适用的场景:- 单轮或短对话(没必要这么复杂)- 纯知识库查询(RAG 本身够用)原文:dev.to/diego_falciola_02ab709202/every-ai-agent-framework-has-a-memory-problem-heres-how-i-fixed-mine-1ieo#HOW I AI# #程序员#

42. 教程:All-in-RAG | 大模型应用开发实战一:RAG技术全栈指南网页链接本项目是一个面向大模型应用开发者的RAG(检索增强生成)技术全栈教程,旨在通过体系化的学习路径和动手实践项目,帮助开发者掌握基于大语言模型的RAG应用开发技能,构建生产级的智能问答和知识检索系统。主要内容包括: RAG技术基础:深入浅出地介绍RAG的核心概念、技术原理和应用场景 数据处理全流程:从数据加载、清洗到文本分块的完整数据准备流程 索引构建与优化:向量嵌入、多模态嵌入、向量数据库构建及索引优化技术 检索技术进阶:混合检索、查询构建、Text2SQL等高级检索技术 生成集成与评估:格式化生成、系统评估与优化方法 项目实战:从基础到进阶的完整RAG应用开发实践#微博兴趣创作计划#

43. RAG(检索增强生成)会不会消亡呢?

44. 「Github一周热点98期」AI文档检索框架、微软最新TTS、Claude Code 记忆插件、自动化备份、 jellyfin和linux桌面环境

45. 两个教学项目:1️⃣从零开始构建 AI 智能体github.com/pguso/ai-agents-from-scratch本仓库教你从基本原理开始,使用本地 LLM 和 node-llama-cpp 构建 AI 代理。通过完成这些示例,你将理解:✨LLM 的基本工作原理✨智能体究竟是什么(LLM + 工具 + 模式)✨不同智能体架构的运作方式✨框架为何做出某些设计选择理念:通过构建学习。深入理解后,再明智地使用框架。2️⃣从零开始构建RAGgithub.com/pguso/rag-from-scratch通过一步步构建RAG(检索增强生成)来解密它的原理。没有黑箱。没有云API。只有清晰的解释、简单的示例和你完全理解的本地代码。这个项目遵循与《从零开始构建 AI 智能体》相同的理念:通过简洁、解释清楚的真实代码,使开发者能够理解先进的AI概念。你将学到:✨RAG到底是什么,以及它为何在知识检索中如此强大。✨嵌入(embeddings)如何工作,如何将文本转化为模型能理解的数字。✨如何构建本地向量数据库,高效地存储和查询文档。✨如何连接所有内容,检索上下文并将其输入到大语言模型(LLM)中以获得有依据的答案。✨如何重新排序和规范化,提高检索精度并减少噪声。✨一步步的代码演示,每个函数都有解释,毫不隐瞒。#科技先锋官#

46. 🚨突发新闻:Qwen 团队刚刚发布了他们的官方代理框架,它包含了所有功能。无需拼接第三方库。无需对抗抽象概念。Qwen-Agent 为您提供:→框架内直接内置的原生函数调用→开箱即用的安全代码解释器沙箱→ RAG 和 MCP 支持包括→用于浏览器原生代理工作流程的 Chrome 扩展程序由构建模型的团队开发,所以它运行稳定可靠。100% 开源且完全免费。

47. 构建智能问答系统通常面临查询模糊、上下文理解不足和检索效率低等挑战。Agentic RAG for Dummies 是一个基于 LangGraph 的极简 Agentic RAG(检索增强生成)框架,帮助你用最少代码快速搭建具备会话记忆和人机交互查询澄清能力的生产级系统。 项目集成了多功能模块: - 会话记忆,保持对话上下文连贯; - 智能查询澄清,自动重写或请求补充信息; - 分层索引,实现精准且上下文丰富的检索; - 多Agent并行处理复杂多问; - 灵活切换多种大语言模型(Ollama、OpenAI、Google Gemini 等); - 开箱即用的 Gradio Web UI,方便体验和部署。 无论是学习 RAG 基础,还是构建定制化应用,这个项目都提供了交互式笔记本和模块化代码两条路径,助力开发者快速上手并轻松扩展。 GitHub 地址:github.com/GiovanniPasq/agentic-rag-for-dummies/ 主要功能: - 支持多轮对话记忆,提升问答自然度; - 自动拆分复杂查询,精准定位信息点; - 结合关键词稀疏向量和语义稠密向量的混合检索; - 内置人机交互机制,避免误解或无效查询; - 多Agent协同,提升复杂问题的处理效率; - 完整文档处理流水线,支持 PDF 转 Markdown 及分块索引。 适合 AI 研究者、开发者及数据工程师,轻松构建满足生产需求的智能问答系统。

48. 【保姆级】RAG智能体终极方案:n8n+Google File Search,零门槛搭建高精度RAG工作流!

49. RAG原理介绍

50. 万字详解 RAG 基础概念

51. RAG 技术深度

52. LangChain检索增强生成(RAG)技术深度解析

53. 28个RAG面试高频问题解析

54. 2026企业级智能体架构

55. RAG知识库工作原理与技术架构详解

56. 印象笔记 | RAG: 检索增强生成

57. 【技术分享】——RAG(检索增强生成)

58. 什么是检索增强生成(RAG)?一个高质量知识库背后的技术全流程

59. 检索增强生成(RAG)

60. 【2025最新版】RAG实战开发教程,细致讲解RAG检索增强生成的理论与实战代码,让你彻底掌握!

61. 【2026年学RAG】一个月学

62. 检索增强生成(RAG)——简介

63. 为什么大模型要限制上下文长度?不是故意卡你,是你没找对记忆方法

64. 【OpenClaw 记忆机制】第1课

65. 告别拼凑

66. 大模型应用开发系列教程

67. 为什么 AI 不能有无限记忆?到底什么是上下文窗口限制?

68. 大模型应用

69. 大模型RAG

70. 图解大模型,第九章

71. RAG喊死了三年,Glean和DoorDash为什么还在用?

72. 给AI接上专有知识库

73. 这款开源 AI 平台太强了!RAG、深度研究、代码执行全都有

74. 一文读懂

75. 深夜调试 RAG 系统后,我总结了这 5 个让检索准确率翻倍的核心技巧

76. RAG(检索增强生成)原理及全流程详解(一)

77. 如何将RAG技术应用于本地知识库的构建?

78. 企业AI落地遇坑!通用大模型变"门外汉",RAG技术成救命稻草

79. 从“人工智障”到“金牌销售”

80. 纯享笔记

81. LLM落地企业合规

82. AIGC产品经理

83. 50 行代码,手把手构建 RAG Agent 知识问答助手

84. 大模型方案初尝试--基于RAG检测工程代码问题

85. AI大模型|RAG实战 - 哔哩哔哩

86. 别再用切块 RAG 了!这个开源工具让 AI 真正「读懂」你所有文档

87. 为什么“传统的”RAG不够用了?

88. 深度解析RAG(检索增强生成)的安全命门与防御之道【AI安全第七期】

89. Python 企业级大模型应用开发

90. 企业级RAG解决方案 | 从技术架构到落地,赋能企业数智化转型

91. 从检索到生成!这款轻量 RAG 框架一站式搞定 RAG 全流程

92. 扒了51万行代码后

93. 面向小白的Agentic RAG开源项目

94. 首个基于 MCP 架构的 RAG 框架!UltraRAG v2 如何重构检索增强生成?

95. 超越基础RAG

96. RAG 工作原理及流程

97. RAG技术深度解析:核心原理与主流架构全揭秘!

98. [ICLR 2026] CF-RAG:从相关性检索到因果判别的RAG范式转变

99. 企业级 RAG 系统搭建全指南:从原型到生产的落地实践

100. 当AI Agent学会自律:OpenClaw的记忆系统能解决大模型的遗忘症吗?

101. 模型原生的智能体记忆:存算一体+持续学习

102. AI:失忆的天才

103. Ragas框架深度解析:检索增强生成(RAG)系统的无参考自动化评估

104. 成精了?给AI装上“海马体",或将彻底终结大模型“失忆症"

105. 上下文窗口:AI的"短期记忆"有多大?

106. 智能体记忆:为什么学会遗忘比记住更多更重要

107. Stanford AI Research:合成数据训练突破RAG天花板及企业级应用启示

108. 大模型写长篇总“失忆”?一文解决AI小说的记忆难题

109. 【Agent入门到精通】10-上下文工程:Agent系统的”神经系统”

110. 聊了20轮之后AI就开始犯糊涂?聊聊LLM记忆系统的真实困境

111. 大模型的“健忘症”有药了

112. 史上最牛RAG实战项目零基础教程视频(全358集,适合大模型 0基础,RAG自学入门)

113. 大模型落地企业场景:RAG与微调如何选择?这篇指南值得收藏

114. 🚀【进阶篇】第 8 课:上下文管理——告别”七秒记忆”进阶版

115. 大模型RAG技术,从入门到精通,一文彻底搞懂RAG

116. 大模型的上下文会腐烂,这是大模型内生的缺陷。并不是给钱越多,上下文越大,就越好用。

117. 💡 RAG还是微调?企业级大模型落地策略

118. 别再让AI断片!深度解析LLM上下文窗口:从原理到优化

119. Agent 记忆

120. 你的私域数据,是选择RAG还是微调?这决定了AI是“临时工”还是“老员工”​

121. 拒绝大模型“胡说八道”:用通俗语言讲透RAG技术原理

122. WriteBack-RAG:让 RAG 系统的知识库"学会进化"

123. 大模型突破上下文限制,一篇文章读懂未来趋势

124. LlamaIndex技术深度解析:从数据框架到高级RAG实践

125. agent智能体长期记忆机制的思考与工程

126. 从复杂到原子:通过知识感知推理提升RAG

127. 极客时间大模型RAG 进阶实战营【完结百度网盘】\n - 哔哩哔哩

128. 什么是 LlamaIndex,它为何出现?它主要解决了什么问题?

129. 模型记忆力的显著突破 大模型最大的bug,可能要被修复了。 你有没有发现,跟AI聊天聊久了它就开始忘事?这其实不是幻觉,是因为现在所有大模型本质上都是"金鱼脑",上下文窗口就那么大,超了就丢。 最近有个团队发了篇论文叫MSA,做了件狠事:不靠外挂数据库,不靠暴力扩窗口,直接让模型自己学会"挑重点记"。 结果一个40亿参数的小模型,记忆力吊打2350亿参数的大系统。而且跑1亿token的推理用两张卡就够。 虽然代码还没放出来,但如果这东西能落地,AI助手、AI角色扮演、企业知识库这些场景全部会被重写。 #大模型 #ai #知识分享

130. 开源RAG引擎RAGFlow:企业级知识管理的革命性解决方案

131. 上下文的秘密:为什么AI总是"忘记"你说过的话?

132. Python让AI大模型有据可查,RAG 检索增强生成技术指南

133. Agentic RAG + MCP 架构的企业级问答系统

134. RAGFlow - 开源RAG引擎深度解析

135. 2026企业级AI业务落地指南:从私有化知识库到AI智能体部署

136. Adaptive RAG:新一代智能检索增强生成,大模型优化!

137. 企业知识库 RAG 落地:从架构选型到组件决策的完整思路

138. LightRAG_技术介绍

139. 基于 Dify 构建企业级AI智能知识库的实践之路

140. 项目搭建-RAG智能体工作流(含代码)

141. 基于RAG架构(一站式打造本地知识库企业级解决方案)\n - 哔哩哔哩

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章