阿里巴巴云团队的研究挑战了“模型越大越好”的观念。他们创新的“师生教学法”让一个仅40亿参数的小模型,在数学和编程等复杂推理任务上,超越了参数规模达320亿的大模型。这为AI的高效学习和普及应用开辟了新路径,证明了精巧的学习方法比单纯的参数堆砌更重要。
智能速览
一个40亿参数的小模型在数学推理测试中超越了320亿参数的大模型。
通过“温度调节学习法”让AI从简单到复杂逐步掌握推理能力。
利用“分歧感知采样”精准定位AI最需要学习的内容。
采用“混合策略蒸馏”帮助模型实现从依赖到独立的平稳过渡。
整个训练过程仅使用了44.8万个高质量样本,效率极高。
模型、数据和代码均已开源,降低了高性能AI的应用门槛。
精华内容
小模型如何练就强大的推理能力?答案不在于更大的规模,而在于更聪明的学习方法。下面将深入解析这套“师生教学法”的核心机制。
循序渐进的学习路径
传统AI训练如同让学生随机做题,效果不佳。阿里巴巴团队提出的“温度调节学习法”则模拟了科学的教学过程。
在AI训练中,“温度”决定了答案的特性:低温度下模型输出更确定、标准的答案,类似基础题;高温度下则产生更多样化、探索性的答案,类似难题。该方法先用低温度数据为模型构建稳固的基础思维框架,再逐步引入高温度数据以拓展其思维的广度和深度。
实验结果验证了该策略的有效性。在数学推理测试AIME24中,采用温度调节学习的模型得分达到85.2分,在AIME25中获得81.3分,显著优于仅使用单一温度数据的训练方法,表明由易到难的规律能显著提升AI的推理能力。
精准定位学习盲区
在确定学习顺序后,如何筛选最有价值的训练内容成为关键。分歧感知采样为此提供了智能解决方案。
该方法的核心是对比老师模型(大模型)和学生模型(小模型)对同一问题的判断。研究发现,当“老师很确信但学生没把握”时,这些例子是学生最需要学习、也是最能提升能力的内容。
通过优先筛选这类“师生分歧”大的样本进行训练,模型的学习效率大幅提升。在相同数据量下,使用该策略的模型在AIME24测试中分数从83.1分提升至85.0分,在AIME25测试中从76.1分提升至79.2分,实现了对训练数据的智能利用。
从依赖到独立的过渡
AI模型普遍存在“暴露偏差”问题:训练时有老师指导,应用时却需独立完成。这导致模型在生成长推理时容易“跑偏”。
“混合策略蒸馏”旨在解决这个问题。它让模型先自行尝试回答,当其出现困难或错误时,再由老师模型介入并完成剩余部分。这个过程既给予了学生独立思考的空间,又能在关键时刻提供正确引导,帮助模型平稳过渡到独立推理阶段。
即便只用约7700个混合策略样本,也取得了显著效果。在AIME24测试中,模型分数从83.3分跃升至88.5分,在AIME25测试中从74.2分提升至83.3分。同时,模型的输出也更加稳定和可靠,减少了冗长或重复的回答。
这项研究的真正价值,在于为AI发展提供了“重学习过程,而非模型规模”的新范式。通过开源,阿里巴巴云团队让高性能推理技术不再遥不可及。未来,当更多开发者能在此基础上创新,AI的应用边界将被无限拓宽。或许,下一个突破就诞生于某个普通实验室甚至个人电脑中?