百万token上下文卷疯了,但我劝你省钱用RAG

源自60位全网作者

08-01 23:22

内容由AI生成

精选参考来源

1. 1M 上下文不是越长越好:长上下文到底怎么用,什么时候该用 RAG

2. RAG与Long Context的终极对决:当Transformer上下文窗口飙至1M,RAG检索架构会被抛弃吗?

3. 长上下文来了,RAG 还有必要吗?

4. RAG、微调、长上下文,到底什么时候用哪个?

5. 长上下文 vs RAG:什么时候该用哪个?

6. 大模型支持的上下文已超 1M, RAG 是不是没有意义了?

7. 长上下文 vs RAG:3个临界点决定你该怎么选

8. LLM无限上下文了,RAG还有意义吗?

9. 别再争“RAG已死”:长上下文时代,90% 团队真正做错的是架构分工

10. Long Context 和 RAG 的共性和差异

11. 北大 |全局记忆增强的长上下文检索生成。📄一句话介绍:通过全局记忆模块生成检索线索,提升长文档复杂查询场景下的RAG效果 🎯动机 RAG在长文档处理中长期受限于检索质量。该领域的发展经历了几个阶段:早期方法直接将用户查询编码后与文档片段做相似度匹配,简洁有效但仅适用于查询意图明确、答案可直接定位的场景;随后HyDE、RQ-RAG等方法在查询侧引入改写与分解,缓解了表达不匹配问题,但仍困于"查询本身缺乏文档上下文信息"的根本局限;GraphRAG等转向预构建知识图谱以获取全局视角,效果显著但索引代价高昂,难以应对原始非结构化长文档。核心问题在于:能否让检索器以较低成本获得整篇文档的全局理解,从而胜任隐式查询、多跳推理与跨段综合等任务? 💡方法与创新 MemoRAG提出"轻量记忆模型 + 表达性生成模型"的双系统架构,核心创新体现在三个方面: 一是基于KV压缩的全局记忆模块。在原始上下文中周期性插入记忆token,通过独立训练的记忆专用权重矩阵对长序列进行有损压缩,压缩比β可在4至64之间调节,使128K上下文的LLM最高可承载8M token的输入。 二是线索驱动的检索范式。面对隐式或抽象查询,记忆模块先生成一段草稿线索——可能不精确但揭示了潜在的信息需求,如将"主要角色之间的关系"转化为具体的人名与关系描述,再以线索作为代理查询去召回精确证据。 三是面向生成质量的强化学习训练。三阶段流程依次完成记忆预训练、线索SFT与RLGF,其中RLGF不直接评估线索本身的准确性,而是以最终答案质量为奖励信号,通过偏好排序损失反向优化记忆,确保生成的线索真正有利于下游检索与作答。 📊实验设计 实验覆盖LongBench、InfiniteBench与跨20个垂直领域的UltraDomain基准(上下文最长1M token),对比全上下文方法、标准RAG(BGE-M3、Stella、Jina)及HyDE、RQ-RAG、GraphRAG等增强方案。MemoRAG平均得分40.2,超过全上下文基线的35.0;NarrativeQA从21.4提升至27.5(相对增益28.5%),多文档问答2WikiMQA上54.1对38.1。 #智能体 #智能体记忆 #AI #科研 #大模型

12. RAG:长上下文(Long-Context )时代

13. RAG 已死?长上下文窗口正在摧毁向量数据库赛道,还是两者可以共存?

14. RAG 与长上下文:如何为语言模型装上「可更新的记忆」

15. RAG · 检索与长上下文——让 AI「看见」你的私有数据

16. RAG 与长上下文大模型:统一技术视角与方法综述

17. 纠结 RAG 还是微调?一篇文章讲清 RAG、微调、长上下文到底怎么选!

18. 大模型处理长文档:RAG 还是长文本模型?这一篇终于讲透了!

19. 别再问「哪个更好」了,先搞清楚你的场景

20. Meta如何给RAG做Context Engineering,让模型上下文增加16倍

21. 2026 AI 开发者生存指南(6):RAG 技术最新进展与落地实践——2026 年还有哪些坑?

22. RAG VS 超长上下文:模型能读完一整本书,向量检索还有必要吗?

23. FAB-Bench发布,200组RAG测试暴露长上下文失真

24. 面试官问:长上下文和 RAG 到底怎么选?

25. AI 概念日志 · 第 013 讲|长上下文:1M 是营销

26. Q-RAG:基于值函数嵌入训练的长上下文多步检索方法

27. 长上下文还是CAG?AI记忆机制的两条路线

28. 长上下文不是长期记忆:为什么 1M Context 也不会淘汰 RAG

29. 从参数大战到长文本革命?DeepSeek V4把百万token上下文价格压到1元/百万 刚发布的DeepSeek V4 Pro,把100万token上下文的输入价格做到了1元/百万,这比智谱GLM-5.1还低。中国大模型的长上下文竞赛,现在不看参数规模了,看谁能把算量压下去。 它的秘诀在MoE架构,1.6万亿参数模型不用每次都加载全部参数,只调用相关专家模块。这种混合专家模型让V4 Flash版的输出价格低至2元/百万token,普通开发者能负担起处理一整本书的需求了。 企事界北京科技有限公司执行董事李睿说,这意味着大模型从实验室走向企业知识库,过去长文本处理是高端付费功能,现在成本和手机流量费差不多了。 有人会说其他模型也能做长上下文,但能在开源框架下同时保持1.6万亿参数规模和1元级价格的,目前只有DeepSeek V4。这步棋,彻底改写了大模型的成本比较逻辑。 当模型不再是天价玩具,普通企业就能用AI处理复杂文档,这或许才是大模型真正的转折点。

30. 上下文窗口越大越好吗?聊聊长上下文的代价

31. 刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习

32. 追求 AI 记忆力的路线下,RAG 是否终将被抛弃?

33. 姚顺雨在腾讯首个研究:在“上下文”这事上,在座的各位都不及格

34. Kimi K3 已提前亮相?神秘模型「Kivine」现身,百万上下文能力惊艳全球

35. 万字解读:为何长上下文治不了多模态 AI 的「健忘症」?丨GAIR Live 031

36. 智能体上下文工程:为什么文件系统成了AI记忆的最佳载体?

37. 大模型上下文工程指南

38. 使用 Claude Code:会话管理与 100 万上下文

39. Agentic Search 和 RAG RAG 是“先检索再生成”的固定流程;Agentic Search 是“由智能体自主规划与多轮搜索”的动态流程。 RAG:一次或少量检索,把文档喂给模型回答,简单、稳定、成本低。 Agentic Search:会拆解问题、改写查询、迭代检索、比较来源、必

40. AI 术语通俗词典:上下文

41. AI 术语通俗词典:大模型幻觉

42. 2026年程序员不懂RAG+Agent,将会落后于职场

43. GPT-5.6 惊现 150 万上下文窗口,将如何影响大模型竞争格局?

44. Databricks CEO:我们不需要AI更聪明,只需要更长上下文

45. 阿里云为何选DeepSeek-V4-Pro?大模型竞赛进入工程化维度 阿里云选DeepSeek-V4-Pro当降价先锋,不是随便选的。这款模型有1M超长上下文,能轻松处理百万级Token的多轮对话,MoE架构还让推理成本更低。阿里云用它做降价载体,藏了三个小心思:第一,DeepSeek本身是开源力量

46. 【Agent 开发范式演进:从环境工程出发,“简化”多源实时上下文】本文基于阿里云沈林在2026中国生成式AI大会的分享,指出企业级Agent落地瓶颈不在模型,而在上下文供给能力。文章从“环境工程”视角,提出信息完备性、感官管理、知识对账、变更治理、普惠门槛五大维度,探讨如何让Agent低成本、可靠

47. Claude 4.6 百万 Token 上下文正式开放,不加钱,这 3 个使用场景效率直接翻倍

48. Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文

49. 创新Transformer!面壁基于稀疏-线性混合架构SALA训练9B模型,端侧跑通百万上下文

50. GLM-5.2来了,Claude Code百万上下文怎么配?

51. 从RAG到记忆工程:AI长期记忆系统的架构范式与落地瓶颈

52. 相约 GenAICon 北京站:聊聊从环境工程出发,如何“简化”多源实时上下文?

53. RAG退潮,“文件系统+grep”回归,智能体检索的返璞归真

54. 【告别“伪智能”代码:用 Spec + RAG 打造真正懂你的AI程序员】本文提出“SPEC(硬规则)+ RAG(软上下文)+ MCP(标准化接口)”三位一体AI编码知识增强体系:SPEC保障代码准确性与可验证性;RAG动态检索非结构化知识提升语境理解;MCP实现工具与数据的安全、灵活集成,共同解决

55. 长上下文方案对比:一文讲清从 RAG、KV Cache 到百万上下文的工程取舍

56. 长文档处理进入新阶段:Claude4.8 百万级上下文能力解析

57. 长上下文模型:能塞更多不等于更聪明

58. Gemini 100万 Token 上下文,长文档处理炸裂教程

59. LCAS V3.1:解决大模型长文本写崩、出现幻觉的提示词技术

60. 上下文无限扩容带来的技术隐患

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章