快手新论文QARM V2提出了一种创新框架,旨在解决工业推荐系统中超长用户序列建模的长期挑战。该框架通过将大型语言模型的深度语义理解能力与传统推荐模型高效结合,克服了ID embedding的固有局限性,为提升推荐效果提供了全新的技术路径。
智能速览
传统推荐系统在处理超长用户序列时,面临着ID embedding的结构性难题。
QARM V2框架的核心是“推理式对齐”,利用LLM过滤噪声、增强数据相关性。
通过“语义ID量化”技术,将连续的LLM embedding转化为下游模型可学习的离散码。
该方案在快手广告、电商等多个业务场景中实现了离线与在线性能的全面提升。
实验发现保留用户重复交互行为,如多次观看同一直播,能提升模型效果。
精华内容
将大语言模型(LLM)的优势融入推荐系统并非易事,QARM V2框架通过巧妙设计,成功搭建了一座桥梁,让LLM的深度理解能力与工业推荐系统的高效性得以完美结合。
超长序列的瓶颈
在工业级推荐系统中,用户历史交互序列极长,可达上亿次。直接将全量序列输入排序模型计算成本高昂,因此业界普遍采用两阶段模式:GSU(通用搜索单元)负责从海量历史中粗筛出相关子序列,ESU(精确搜索单元)则在此子序列上精建模。然而,这种依赖ID embedding的传统方法存在结构性问题,如信息密度低、泛化能力差,难以捕捉深层语义关联。
推理式对齐的智慧
QARM V2并未简单地将LLM的静态特征拼接到模型中,而是通过“推理式对齐”机制深度整合。其核心思想是利用最新预训练的LLM作为“数据质检员”,判断从现有检索模型导出的高相似物品对在世界知识层面是否真正相关,从而过滤噪声。
这种方法将原本基于统计共现的监督信号,提升为更具可解释性的“场景或用途相关”,有效解决了LLM语义空间与推荐系统目标不匹配的问题,让召回更精准。
语义ID量化巧思
要让LLM的表示在ESU阶段可学习,关键在于将其连续的embedding向量转化为离散码。论文提出的“语义ID量化”技术,特别是Res-KmeansFSQ方法,巧妙地解决了工业物品长尾分布带来的码本冲突问题。
它结合了残差K-means(Res-Kmeans)与有限标量量化(FSQ)的优点,前者负责适配主流分布,后者则在最后一层提供更均匀的细粒度划分。这不仅降低了冲突,也让下游模型能为这些离散码分配可训练的embedding,实现了端到端优化。
真实场景的验证
QARM V2的成效在真实业务中得到了验证。在Amazon Books数据集上,其AUC达到70.33%,优于多个主流基线模型。在快手的广告、电商、直播等多个核心服务中,离线指标如AUC、GAUC均有显著提升。
在线A/B测试也表明,该框架能带来可观的业务增益。一个有趣的发现是,保留用户历史序列中的重复交互(而非去重)能更好地捕捉用户的兴趣强度与时段偏好,进一步提升了模型效果。
快手的QARM V2框架为解决超长用户序列推荐难题提供了创新思路,它通过推理式对齐与语义ID量化,成功将LLM的强大能力高效融入工业推荐系统。这不仅是技术上的突破,也为未来推荐系统与生成式AI的深度融合指明了方向,探索更长的序列与更精细的表达将是下一步的关键。