张大妈

AI搜索新突破:从淘宝优化到TagRAG

源自公众号:老刘说NLP

01-14 20:04

面对AI搜索精准与覆盖的矛盾,淘宝的LLM插件给出了新解法。同时,一种名为TagRAG的框架正试图重塑知识图谱构建,大幅提升效率。这篇文章深入解析了这两项前沿技术的核心思路与实测效果,为解决工程落地难题提供了新视角。

AI搜索新突破:从淘宝优化到TagRAG智能速览

  • 淘宝AI搜索插件解决了“找不到”和“太杂”的核心矛盾。

  • LEAPS框架通过三阶段微调合成数据,点击率提升16.4%。

  • TagRAG用标签链代替社区摘要,构建效率提升14.6倍。

  • 下游验证器整合多源数据,通过CoT推理实现精准过滤。

  • 新方法虽能扩大召回,但生成数据难以复用是共同痛点。

AI搜索新突破:从淘宝优化到TagRAG精华内容

技术突破往往源于对核心矛盾的拆解。淘宝搜索优化与TagRAG正是如此,它们从不同维度切入,探索AI应用的新可能。

淘宝搜索新解

传统电商AI搜索面临两难:精准描述导致零结果,泛化搜索则造成信息过载。为此,一项名为LEAPS的LLM自适应插件应运而生,旨在通过查询扩展和结果验证,找到“宽覆盖”与“高精度”的平衡点。该方案在不改动底层搜索引擎的前提下,实现了点击率(CTR)提升16.4%,低结果率(LRR)降低31.7%的显著效果。

这种插件化思路,为复杂系统的渐进式优化提供了范例,证明在工程侧巧思也能带来算法层面的巨大收益。

三阶段数据微调

为解决“零结果”问题,LEAPS的查询扩展器采用了三阶段训练策略。首先,通过逆数据增强,从200万条高质量商品标题反向生成口语化查询,构建了坚实的〈查询-重写〉基础。接着,利用20万条真实搜索查询进行后验知识SFT,通过分解属性、生成重写、引擎验证和评分筛选,让模型学会在真实场景下工作。

最后,针对5万条独特查询进行多样性强化学习(RL),通过设计混合相关性和有效相关性等三类奖励信号进行优化。实验证明,GSPO算法在稳定性与收敛效果上最优,在230步训练后达到0.61的峰值奖励。

智能验证过滤

面对“决策过载”难题,LEAPS的下游相关性验证器充当了决策代理。它整合了商品标题、OCR文本、用户评论、价格、销量、品牌声誉等多源异构数据,构建了更全面的商品理解。

通过多指令SFT,模型将人类决策逻辑内化为思维链(CoT)推理能力,能输出相关性标签并附带简洁理由,有效过滤不符合复杂约束的噪声商品。这一过程将筛选负担从用户转移至系统,通过自动批处理和动态分页策略,实现了平均150ms的低延迟高效部署。

TagRAG新思路

在知识图谱检索增强生成(GraphRAG)领域,一种名为TagRAG的新框架提供了不同视角。它不再依赖LLM提取实体并构建社区摘要,而是转而从标签角度入手,构建分层知识图谱。其核心在于,先从文档中提取对象标签及关系,再将这些对象标签关联到预定义的根领域标签,形成有向无环图(DAG)的领域标签链。

这种方法将复杂的图构建问题,转化为相对可控的标签提取与组织问题。

效率提升与反思

TagRAG的评估数据集覆盖农业、计算机科学、法律等多个领域。与NaiveRAG、GraphRAG等基线模型相比,TagRAG展现出巨大优势。其构建效率是GraphRAG的14.6倍,检索效率是1.9倍,增量构建时间从30.47小时缩短至6.37小时。

核心原因在于,TagRAG通过领域标签链替代了耗时的社区摘要,大幅减少了LLM调用次数和全图重构成本。然而,一个值得深思的观点是,这类方案的本质都是通过暴力扩展路径来提升召回率,但其产生的标签、摘要等中间产物,难以作为高质量数据资产被复用,这或许是当前RAG技术的普遍局限。

无论是电商搜索的精细化运营,还是知识检索的效率革命,技术迭代始终围绕解决实际痛点。这些探索为AI在更多场景的落地铺平了道路,但其数据资产的长期价值,或许值得更多思考。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章