奖励模型变天!0.005%参数量推理速度翻倍,性能还更强

源自公众号:新智元

01-31 20:06

大模型推理增强的奖励模型瓶颈迎来突破。SWIFT技术不再依赖庞大的文本模型,而是直接从生成过程中的隐藏状态提取奖励信号,以不到0.005%的参数量,实现了推理速度和性能的双重超越,为高效部署提供了新范式。

奖励模型变天!0.005%参数量推理速度翻倍,性能还更强智能速览

  • SWIFT直接利用大模型生成过程的隐藏状态构建奖励模型。

  • 参数量仅为传统奖励模型的不到0.005%,实现数量级压缩。

  • 在多个基准测试中性能超越主流方案,推理速度提升1.7至6.7倍。

  • 在有用性与安全性等对齐评估任务中同样表现出色。

  • 可与传统奖励模型组合,进一步提升性能,且几乎不增加额外开销。

奖励模型变天!0.005%参数量推理速度翻倍,性能还更强精华内容

传统奖励模型依赖外部评估,而SWIFT另辟蹊径,直接挖掘模型在生成过程中隐藏的内在判断信号,从而实现了极致的轻量化与高效化。

挖掘内在信号

在大模型推理增强的Best-of-N策略中,评估候选答案的奖励模型通常自身规模庞大、推理开销高,成为部署瓶颈。SWIFT的出发点是一个关键观察:大模型生成答案时,其内部的隐藏状态已携带关于推理正确性、置信度的丰富信息。与其用外部模型“读结果”,不如直接从模型自身内部提取这些内在信号,构建轻量级奖励模型。

词元级加权打分

SWIFT的结构简洁高效。它对生成序列中的每个词元,收集其对应的隐藏状态,通过一个线性映射同时预测该词元的奖励分数和重要性门控权重。随后,利用门控权重对所有词元的奖励进行加权平均,得到整条路径的最终分数。这种设计使模型能自动关注关键推理步骤,参数规模仅与层数和隐藏维度成正比,压缩至传统模型的0.005%以下。

多基准全面领先

在MATH、GSM8K、HellaSwag等多项核心基准测试中,SWIFT在不同底座模型与不同N值(候选答案数量)配置下,Best-of-N的准确率均优于多种主流开源奖励模型。更重要的是,端到端推理测试显示,替换为SWIFT后,整体耗时实现了1.7倍至6.7倍的加速,所需计算量也大幅减少,效率优势达到数量级。

超越推理的对齐能力

SWIFT的潜力不限于推理任务。在PKU-SafeRLHF数据集的对齐评估中,其在有用性与安全性两个维度上均优于大型文本奖励模型。这表明隐藏状态信息同样能刻画广义的响应质量。此外,SWIFT具备高度工程灵活性:支持仅用后层隐藏状态训练、仅基于输出分布训练,或与传统模型组合使用,在几乎不增加成本的前提下进一步提升系统性能。

SWIFT为大模型奖励建模开辟了一条新路径,证明性能提升不一定依赖更庞大的外部模型,而可源于对自身机制的深度挖掘。其高效、通用的特性,预示着它在未来大规模智能系统中的广阔应用前景。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章