短视频推荐常陷入“看得久”与“看得多”的两难,传统调参难以兼顾。清华大学与快手联合提出的HMUM模型,首次将多处理因果推断大规模应用于该场景,通过创新的因果视角和双模块设计,实现了个性化、多目标的协同优化,为解决这一核心矛盾提供了全新思路。
智能速览
HMUM模型以因果视角处理多策略冲突,实现个性化多目标优化。
其双模块设计(HUM+DDM)能捕捉处理效应并动态分配指标权重。
创新KL约束解决了多处理分支的非处理分布漂移问题。
模型在快手亿级流量场景中上线,时长和播放量均获显著提升。
全面优于S-Learner、TARNet等现有模型,在工业与公共数据上均达SOTA。
精华内容
HMUM模型的核心突破在于其精巧的结构设计,它通过双模块协同工作,从因果层面解耦并优化多个推荐策略,真正实现了“按人决策”。
推荐两难
短视频推荐系统普遍面临“看得久”与“看得多”的内在矛盾。过度追求用户观看时长,可能会减少视频曝光总数,从而影响平台整体的流量分配和商业潜力;反之,若优先提升曝光量,又可能因内容质量参差不齐而损害用户体验,导致用户停留时长下降。传统依靠经验和人工调参的策略,难以在这种多目标冲突中找到最佳平衡点,尤其是在日活数亿的庞大用户群中,微小的参数调整都可能引发连锁反应,使得优化工作变得异常复杂。
双模块协同
HMUM通过HUM和DDM两个模块的协同来应对这一挑战。HUM模块是模型的核心,它能同时学习多个推荐策略的独立因果效应与它们之间的协同效应。这意味着模型不仅能判断某个策略对单个用户是否有效,还能理解不同策略组合时产生的增益或抑制效果。DDM模块则负责根据用户的实时行为特征,动态地为“观看时长”、“视频曝光”等多个指标分配权重。这一设计使得推荐系统能够真正做到“按人决策”,为不同状态下的用户提供当前最合适的策略组合。
创新KL约束
在多策略建模中,一个棘手的问题是“非处理分布不一致”。简单来说,当为不同策略独立建模时,它们预测的“未施加任何策略时的结果”会产生偏差和漂移,导致模型无法公平地比较各策略的真实效果。HMUM创新性地引入了KL散度约束,通过“对齐”不同策略分支下的非处理分布,确保了评估基准的一致性。论文的可视化结果也证实,该方法显著提升了不同策略间基线分布的重合度,从结构上保证了因果推断的准确性。
实践验证
理论的创新最终需要通过实践检验。HMUM模型在快手的Ranking和Edge Rerank两个核心场景中进行了亿级流量的A/B测试,取得了显著的正向收益。数据显示,APP使用时长分别提升了0.044%和0.073%,人均时长也相应增加了0.055%和0.072%。对于日活数亿的平台而言,这种“千分级”的提升意味着巨大的商业价值和用户体验改善。同时,视频播放量保持稳定,表明模型在优化核心指标时并未损害其他关键业务,实现了稳健的多目标增长。
HMUM模型的成功,标志着因果推断技术在超大规模推荐系统落地中迈出了重要一步。它不仅为短视频行业提供了多目标优化的新范式,也为其他面临类似多策略冲突的复杂系统开辟了道路。未来,如何将这种因果思想更广泛地应用于不同业务场景,将是值得持续探索的方向。