张大妈

4B超越Qwen3-32B!阿里开源轻量级推理模型,引入序列蒸馏新范式提升长链推理

源自今日头条:智猩猩

01-27 13:52

长思维链推理能力一直是小模型的短板。阿里巴巴团队提出分布对齐序列蒸馏(DASD)新范式,通过温度调度、差异感知采样等创新,有效解决了传统蒸馏方法的痛点。这项技术让4B轻量模型在数学、代码等核心任务上超越多个32B大模型,实现了小参数、少数据的极致推理效率。

4B超越Qwen3-32B!阿里开源轻量级推理模型,引入序列蒸馏新范式提升长链推理智能速览

  • 传统序列蒸馏存在分布覆盖不足、师生错位等痛点。

  • DASD新范式通过温度调度与差异感知采样解决问题。

  • DASD-4B模型仅需448K样本训练,效率极高。

  • 在数学、代码、科学问答三大任务上均达到SOTA性能。

  • 其性能超越同规模模型,并碾压多个32B级大模型。

  • 模型权重与数据集已全量开源,可供研究和使用。

4B超越Qwen3-32B!阿里开源轻量级推理模型,引入序列蒸馏新范式提升长链推理精华内容

DASD框架并非简单压缩模型,而是通过一套系统性的数据构造与训练策略,精准地将大模型的深层推理能力转移给小模型,使其在复杂任务中也能表现出色。

温度调度学习

DASD采用两阶段温度调度学习策略,以平衡训练稳定性与数据多样性。

首先在低温(T=0.6)下,从教师模型GPT-OSS-120B采样高置信度输出,帮助学生模型Qwen3-4B快速建立稳定的基础。

随后在高温(T=1.0)下,扩大采样范围以捕获更多稀有推理模式,拓宽模型的知识覆盖面。

消融实验显示,仅低温训练就使AIME25成绩从47.4%跃升至74.0%,证明了该策略的有效性。

差异感知采样

为解决师生模型分布错位问题,DASD提出了差异感知采样(DAS)技术。

该方法将句子分为教师、学生、共享和增强四类,并发现“教师高置信、学生低概率”的句子与最终答案正确性高度正相关。

通过在数据采样阶段优先选择这类样本,模型能专注于学习其知识盲区,有效避免了传统SFT训练中因放大概率差异而产生的误导梯度,从而更精准地吸收教师能力。

混合策略蒸馏

针对训练与推理时的暴露偏差,DASD在最后阶段引入了轻量级的混合策略蒸馏。

该方法先让训练好的学生模型生成响应,然后筛选出与教师输出差异大的实例(如截断响应),再由教师模型续写完成。

最后,仅保留通过质量筛选的教师续写部分用于微调。这种结合学生策略与教师修正的方式,显著提升了模型在真实自回归推理场景下的鲁棒性。

DASD范式的成功,标志着小模型在复杂推理任务上的巨大潜力,为高效AI模型的发展开辟了新路径。通过精巧的数据构造与训练策略,实现“小模型+少数据”的SOTA性能,这对整个AI社区的研究与应用都具有启发意义。未来,这一方法能否在更多领域和架构上创造惊喜?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章