3天上线、2个月填坑:自己写RAG之前,先把这四笔真实复盘账算清

源自6位全网作者

09:41

玩过RAG的人大概都有同款经历:跟着教程把LangChain加向量数据库搭起来,接上大模型API,一个下午就能跑通一个"知识库问答"。丢个问题进去,它像模像样地答了,感觉挺可用。

然后知乎上有个问题给了很多人一盆冷水:"什么场景下我们需要自己开发RAG呢?"高赞回答毫不客气:如果你的需求只是拿几十篇文档让AI能回答问题,用现成产品就行——Coze、Dify、百炼,甚至直接把文档丢给长上下文——不需要自己搞RAG。知乎 需要自己开发的场景,基本都在现成产品搞不定的边界。

这话对不对?我把最近半年里四份真实复盘帖翻出来,替大家把账算了一遍。

演示很便宜,可用很贵

第一个案例最典型。一位开发者被领导安排做公司内部文档问答,Spring AI加向量库,第一版三天上线。知乎 然后被打脸:准确率只有60%左右,十个问题四个答非所问或者胡编。领导亲自试,问"本季度技术部的OKR是什么",AI回答"我无法获取公司OKR信息"。

接下来两个月,他做了六个优化:固定长度切块改成按标题切分(+8个百分点)、加bge-reranker-v2-m3重排(68%直接跳到79%,他口中投入产出比最高的一步)、BM25加向量的混合检索、元数据过滤、LLM意图识别、给回答加来源引用。准确率最后从60%拉到95%。他的原话值得背下来:RAG的瓶颈不在模型,在工程。知乎

3天上线、2个月填坑:自己写RAG之前,先把这四笔真实复盘账算清

第二个案例来自文旅OTA。老系统靠关键词匹配,260道业务题只答对7道,命中率2.7%。作者花了10天,把检索升级成M3E加ChromaDB的语义检索,再叠上RRF混合检索和L1到L4四层业务元数据过滤,命中率拉到100%,质量分从1.96涨到9.59。知乎 注意前提:他的知识库是3218条结构化业务问答。换成一大堆格式混乱的PDF,这个数字不会这么好看。

3天上线、2个月填坑:自己写RAG之前,先把这四笔真实复盘账算清

第三个案例更扎心。一个团队花两个月搭了完整RAG:PDF解析、分块、向量化、存Pinecone、接GPT-4,Recall@5等于0.87,评测数字挺漂亮。知乎 然后第一个真实用户问题就把它问崩了:"上次我们评估过Acme供应商,当时的结论是什么,跟现在的备选方案比有什么差异?"这个问题在任何单一文档里都没有完整答案,需要跨文档推理,而向量相似度匹配的是局部语义相关,不是推理链。

第四个案例在小红书。一篇"rag已死"的帖子:老板让优化RAG效果,milvus里30万+分块,按标题层级切的块,一周时间把内容稠密向量、BM25、摘要向量、假设文档匹配、查询改写、多查询、bge-reranker、Qwen-rerank-8b全试了一遍,召回效果都不行。小红书 帖子4600多赞、500多条评论,评论区全是同款崩溃。

四个案例摆一起,规律一致:演示很便宜,可用很贵。从"能答"到"好用",要花的时间通常是演示的十倍。

那现成平台到底替你省了什么

现在主流的开源知识库平台——Dify、RAGFlow、FastGPT、MaxKB——本质上做的都是同一件事:把上面案例里那条工程链路,解析、切块、混合检索、重排、评测,封装成可视化界面。RAGFlow在8月15日还登上了GitHub热门,定位是融合RAG与Agent能力的开源引擎,深度文档理解是它的卖点之一。哔哩哔哩

3天上线、2个月填坑:自己写RAG之前,先把这四笔真实复盘账算清

对大多数"内部文档问答"需求来说,这类平台足够了:传文档、选模型、配切块策略,一小时能拿到接近案例一第一版的效果。但要注意:平台省的是工程体力,不是效果天花板。案例二、三暴露的天花板——数据脏、问题要跨文档推理——平台同样替你解决不了。

三个问题决定你该走哪条路

第一问:你的问题长什么样?如果九成是单跳事实查询——“报销制度是什么”“这个参数怎么配”——现成平台或低代码拼装就够。如果经常要跨文档综合对比——“这版方案和上一版差在哪”——经典RAG不管自研还是平台都不够看,得看GraphRAG、知识图谱或Agentic检索路线,别在切块参数上死磕。

第二问:你有多少文档,脏不脏?几十到几百篇干净文档,说实话长上下文或直接传文件就行,连RAG平台都省了。几千篇以上、格式复杂——扫描版PDF、表格、图片混排——文档解析才是你最大的坑,带深度解析能力的平台占优,自研的话先给解析层留足预算。

第三问:数据谁能碰?不能出域的敏感数据,开源平台本地部署是中间路线,也是最近讨论越来越多的方向。没有保密要求、纯个人用,SaaS工具就够,别折腾自己。

不管哪条路,过来人都先做了同一件事

这四份复盘里,共识度最高的不是任何调参技巧,而是评测集。案例一的开发者花一周整理了200个问答对——真实提问加边界case——原话是"没有评测集,你所有的优化都是盲人摸象";案例二每一步优化也都靠260道题同口径验证。知乎 所以上手之前,先给自己准备100到200道题:单跳事实、问法变体、答不上来的问题,各占一定比例。有了尺子,优化才谈得上。

一句话总结:RAG的演示很便宜,可用很贵。需求简单就别自己造轮子,现成平台足够;需求复杂,第一步也不是选框架,而是先弄清你的问题属于哪一代技术能解决的。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章