张大妈

DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了

源自公众号:机器之心

01-28 16:52

顶尖推理模型并非仅靠更长的思考时间超越对手,其核心在于模拟了一种复杂的“思维社会”结构。这项发现揭示了AI通过内部模拟多角色对话、辩论与调和来解决问题,为理解其强大的推理能力提供了全新视角。

DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了智能速览

  • 推理模型的强大源于模拟“思维社会”,而非单纯增加计算步数。

  • DeepSeek-R1等模型在推理中展现出更多问答、观点冲突等对话行为。

  • 模型内部的社会情绪角色更具互惠性,形成了类似真实对话的互动模式。

  • 实验证明,引导对话式行为能显著提升模型在复杂任务上的准确率。

  • 强化学习实验表明,模型在追求准确率时会自发涌现出对话式结构。

DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心多个角色吵翻了精华内容

长期以来,人们将AI推理能力的飞跃归因于更长的思考链,但这背后是否隐藏着更深层的机制?最新研究揭示了答案。

何为思维社会

研究发现,顶尖推理模型如DeepSeek-R1,在解决复杂问题时,其内部并非单一的线性思考,而是模拟了一场多智能体的“辩论会”。不同的数字角色各抒己见,提出假设、互相质疑、纠正错误,并最终整合观点以达成正确答案。这种被称为“思维社会”的结构,解释了为何这些模型在逻辑、数学等任务上表现远超传统模型。其智能的涌现,与人类通过社交互动进化出智慧的路径不谋而合。

内部对话的证据

通过分析模型的推理轨迹,研究者识别出四类关键对话行为:提问-回答、视角转换、观点冲突与观点调和。例如,DeepSeek-R1在处理化学问题时会明确表达“不同意”,在不同假设间切换;而传统指令模型如DeepSeek-V3则更倾向于平铺直叙的独白,缺乏这种自我辩论和修正的过程。数据显示,无论参数规模大小,推理模型在对话行为频率上均显著高于指令微调模型。

社会情绪与认知

模型不仅进行对话,还展现出丰富的“社会情绪角色”,包括提供建议、征询观点、表现对抗等。推理模型的角色结构更具互惠平衡性,Jaccard指数更高,表明它们能协调使用不同角色,而非孤立表达。这种对话结构通过两条路径提升推理能力:直接帮助探索更广阔的解空间,并为结果核验、路径回溯等认知策略提供脚手架式支持。

实验验证与启示

在Countdown数学游戏中,当研究者定向增强模型表达“惊讶”的特征时,模型准确率从27.1%飙升至54.8%,几乎翻倍。反之,抑制该特征则导致准确率下降。这证实了对话特征对推理的决定性作用。另一项强化学习实验也显示,即使只奖励最终答案的准确性,模型也会自发地增加对话式行为,从而加速推理能力的形成。

这项研究不仅为理解AI推理能力的本质提供了关键洞见,也为未来模型的发展开辟了新方向——通过构建更智能的“思维社会”来系统性利用群体智慧。未来的AI,是否会像人类社会一样,通过更复杂的内部协作与辩论,来解决更宏大的挑战?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章