面对人工构建的知识库导致AI答非所问的难题,货拉拉探索出一条大模型辅助优化的有效路径。通过结合大模型的理解能力与人工校验,系统性地解决了意图定义不清、问法匹配错误等核心问题,显著提升了知识库的质量与线上服务的精准度。
智能速览
人工构建的知识库存在意图定义不清、问法不匹配等三大问题。
对比了嵌入模型聚类与大模型辅助两种优化方案,后者更优。
通过大模型初始化、人工校验的人机协作流程,完成知识库清洗。
优化后意图类别从44个细化为89个,提升了回复的精准度。
相似问法重归类准确率达65%,验证了方法的有效性。
精华内容
知识库的质量直接决定了RAG系统的表现上限。当传统的人工构建方式暴露出诸多问题时,如何借助大模型的力量,系统性地完成知识库的升级?
问题诊断
初始人工构建的知识库存在三大典型问题,直接影响AI的应答质量。
一是意图名定义不清晰,例如将司机质疑来电真实性的问法,错误地归类为【来电目的】,导致AI回复偏离核心关切。
二是相似问法与意图话术不匹配,比如把“我有固定货源”分到【车子有货了】意图下,造成答非所问。
三是意图过于概括,如将司机因住院、修车、大雪等多种原因导致的无法出车,全部归入【没出车】,无法给出针对性回复。
方案探索
为解决上述问题,首先尝试了业界常用的嵌入模型+聚类方案。
经调研,选用评分较高的Qwen3-Embedding-8B模型,将相似问法转换为向量进行聚类。然而,实践发现该方案存在明显缺陷:聚类结果不可控,类别语义未知,导致重新归类的准确率极低,且意图被过度细分,无法满足业务精细化要求,故而放弃此方案。
人机协作
最终选择大模型语义理解方案,采用“大模型辅助+人工校验”的人机协作模式,分四步走。
第一步,重新定义意图名。先由大模型基于少量样本生成意图名称和描述,再由业务专家根据知识进行二次校验,确保意图名精准概括语义。
第二步,相似问法重新归类。通过抽样迭代优化意图描述,提升大模型分类的prompt质量,再进行全量分类,并对变更的问法进行人工二次校验。
第三步,意图细分。利用大模型生成初步的细分意图方案,再由人工进行最终确认,确保细分逻辑符合业务场景。
第四步,话术生成。借助大模型为每个意图生成多样化的初始话术,极大减轻人工负担,最后由人工进行校验和优化。
优化成效
优化工作取得了显著的数据成效,知识库质量得到实质性提升。
在意图定义方面,通过合并与重命名,明确了意图边界,例如将模糊的【来电目的】优化为精准的【怀疑来电真实性】。
在相似问法归类上,对10%的问法进行了重新分类,准确率达到65%,有效解决了答非所问的问题。
在意图细分上,对63%的意图进行了拆解,意图总类从44个增加到89个。例如,将笼统的【没出车】细分为【车辆故障或维修】、【生病住院】、【在老家】、【外部原因】等,使AI回复更具针对性。
此次实践证明,大模型与人工的协同是提升知识库质量的关键。未来,通过自动化提示词优化等方式,有望进一步解放人力,让知识库的迭代更加高效、智能。