大模型测试阶段的推理效率与成本,一直是业界关注的难题。传统方法因固定采样次数而难以兼顾性能与开销。CMU的一项新研究提出了一种自校准框架,能有效提升模型自身置信度的可靠性,并以此引导动态采样,旨在实现模型推理性能与成本的双赢。
智能速览
传统大模型推理方法存在采样次数固化、自信度不可靠两大瓶颈。
CMU提出的自校准框架,是一个完全无需人工标注的无监督方法。
该方法通过软一致性校准,让模型能输出更可靠的置信度分数。
基于校准后置信度的采样策略,可动态决定何时停止,大幅提升效率。
实验证明,该方法显著降低了预期校准误差,并提升了模型准确率与泛化能力。
此方法仅需微调模型,部署成本低,且不增加额外推理开销。
精华内容
这项技术的核心在于如何让大模型学会“自我审视”,通过自校准将原本不可靠的直觉判断,转变为可用于高效决策的可靠依据。下面将拆解其具体实现路径。
传统方法的困境
当前提升大模型推理效果的常用方法,如Best-of-N和Self-Consistency,存在明显局限性。它们都需要预先设定固定的采样次数,这导致对简单问题会浪费算力,而对复杂问题又可能因采样不足无法找到最优解。更关键的是,大型语言模型自身产生的自信度并不可靠,常常过度自信,无法作为动态调整采样策略的准确依据。
自校准三步法
针对上述问题,研究提出了一种完全无监督的自校准框架。第一步,对种子数据集中的每个查询采样N个响应,并由模型自身为每个响应生成初始自信度。
第二步,采用软一致性方法,将相同答案的响应自信度求和,再除以所有响应自信度的总和,得到每个答案的校准后自信度。
第三步,利用查询、响应和校准后的自信度构建伪训练数据,通过联合训练让模型在一次前向传播中就能直接输出可靠的自信度。
置信度引导采样
基于校准后的自信度,研究设计了高效的采样策略,包含三个核心部分。首先是早停Best-of-N,在采样过程中一旦有某个响应的自信度超过预设阈值便立即停止,避免无效采样。
其次是自信度加权的Self-Consistency,在投票时让自信度更高的响应拥有更大权重。最后是自信度增强的自适应Self-Consistency,通过计算加权相对频率来动态判断停止采样的时机,进一步优化效率。
实测效果显著
实验数据验证了该方法的有效性。在LLaMA3.1-8B和GSM8K数据集上,模型的预期校准误差从13.7%大幅下降至3.79%,准确率也提升了3个百分点。其泛化能力同样出色,在MathQA数据集上,准确率从49.85%提升至64.18%。在效率方面,使用自信度加权的Self-Consistency,仅需5.8%的采样量即可达到标准方法的效果,实现了成本与性能的双赢。
CMU的这项研究为大模型的高效推理提供了一个极具潜力的新思路。它通过巧妙的自校准设计,在不增加额外算力和人工成本的前提下,显著提升了模型的推理效率与准确性。这种无需监督的通用框架,未来是否将成为大模型部署的标准配置,值得持续关注。