大型语言模型训练长期面临准确性与创造力难以兼得的困境。剑桥大学一项突破性研究,揭示了传统方法导致“创造力崩塌”的根源,并提出了一种名为DCR的新框架。该方案通过创新机制,首次在理论上保证了AI可以在追求正确答案的同时,维持丰富且多样的推理策略,为构建更具泛化能力的AI系统开辟了新路径。
智能速览
传统AI训练方法存在“创造力崩塌”的固有缺陷
剑桥研究揭示了准确性与创造力难以兼得的根源
新方法DCR通过“多样性能量”函数来鼓励思维差异
DCR框架包含香农熵与核心覆盖两项核心机制
实验证明DCR能让AI在保持高准确率的同时维持策略多样性
精华内容
这项研究的关键,在于重新定义了AI训练的奖励机制。它不再仅仅追求唯一正确的答案,而是构建了一个能够系统性地识别并奖励多样化、创新性思维路径的全新框架,从根源上解决了创造力流失的问题。
困境根源
传统AI训练方法如同只奖励“标准答案”的应试教育,导致模型出现“创造力崩塌”。研究团队分析了三种主流方法:STaR机制会“赢者通吃”,使模型迅速收敛到单一最优策略;GRPO方法看似公平,却缺乏保护多样性的机制,最终会因随机噪声而固化;DPO方法虽然能均质化概率,却无法促进策略间的概念差异性。这些方法都从不同侧面牺牲了思维的灵活性,导致模型在面对新挑战时失去应变能力。
DCR新框架
为破解此难题,研究团队提出了分布式创造性推理(DCR)框架。其核心是引入“多样性能量”函数,在训练中明确奖励创造性。该框架包含两个关键部分:首先是香农熵,它鼓励模型在多种推理路径上分配概率,确保基础的多样性。其次是更关键的“核心覆盖”项,它通过一个设计的相似性核函数来衡量不同推理路径的语义相似度,以此惩罚那些本质上雷同的策略,从而推动真正意义上的概念创新。
创造力内核
DCR框架的精髓在于其“创造力核函数”。这个函数像一个智能的相似度检测器,能精准识别出哪些推理路径只是在表面上不同,哪些是真正存在差异。更重要的是,该函数设计了“门控”机制,仅在正确的推理路径之间应用多样性压力,避免模型浪费算力去探索“多样化的错误”。通过这种方式,DCR确保了多样性建立在正确性的基础之上,而不是无意义的发散。
实验与前景
在包含12个推理轨迹的合成实验中,DCR的表现优于所有传统方法。STaR迅速崩塌,GRPO缓慢固化,DPO均质化但无结构多样性。唯有DCR成功收敛到稳定的均衡点,既保持了高准确率,又维持了丰富的策略多样性。这意味着,采用DCR训练的AI模型在面对分布外的新任务时,将拥有更强的泛化能力和稳健的规划能力,能够更灵活地解决未知问题。
这项研究不仅是技术层面的突破,更重塑了对AI训练目标的认知。它证明了正确性与创造力可以兼得,关键在于设计精妙的激励机制。未来,随着创造力核函数的不断优化和应用,我们或许能见证AI从解题工具向创新伙伴的真正转变,这为AI技术的发展打开了充满想象力的新大门。