张大妈

认知语境学习:多智能体系统中正确建立信任

源自小红薯:刘东瑞 上海 AI Lab

02-07 10:44

在多智能体AI系统中,盲目跟风会削弱系统鲁棒性。一项研究提出历史感知参考范式,通过智能体间的历史交互来评估同伴可靠性,从而显著提升决策质量,为构建更可靠的协作AI系统提供了新思路。

认知语境学习:多智能体系统中正确建立信任智能速览

  • 智能体盲目从众是系统鲁棒性的主要挑战。

  • 现有方法忽视同伴历史表现,易被虚假推理欺骗。

  • 研究核心转向评估发言者可信度,而非单次回应正确性。

  • ECL框架通过两阶段推理解耦信任估计与最终决策。

  • 小模型借助该方法性能超越8倍大的基线模型。

认知语境学习:多智能体系统中正确建立信任精华内容

面对多智能体系统中的“谄媚”与盲从,如何让个体学会独立判断?关键在于重新定义“信任”,并从同伴历史中寻找答案。

盲从的困境

在由大语言模型构成的多智能体系统中,一个核心的鲁棒性挑战源于“谄媚”现象。即个体智能体倾向于附和多数或看似自信的同伴,即使其观点是错误的。这种行为会误导群体决策,导致整个系统走向一个糟糕的结果。现有的解决方案,如简单的答案聚合,往往只关注当前轮次的内容,完全忽略了同伴的历史表现,因此极易被那些表面合理但实则虚假的推理所欺骗。

信任评估新范式

研究指出,当智能体自身知识不足以验证同伴推理时,直接判断单次回应的正确性是极其困难的。因此,研究目标从“评估推理质量”转向了“基于历史记录来估计同伴的可靠性”。这种历史感知的参考范式,要求智能体在自身不确定时,优先参考那些在历史交互中表现出更高可信度的同伴的观点。

ECL框架的设计

为实现上述范式,研究提出了ECL(Epistemic Context Learning)框架。该框架设计了一个精巧的两阶段推理流程,显式地将“历史信任估计”与“最终推理”这两个环节解耦。在第一阶段,智能体基于历史交互数据评估同伴的可靠性;在第二阶段,结合自身判断和可信同伴的观点进行最终决策。框架还通过强化学习与辅助奖励进行优化。

显著的性能提升

实验结果有力地验证了该方法的优越性。采用ECL框架后,一个仅有4B参数规模的小模型(如Qwen3-4B)在多项任务中的准确率,竟然超越了一个参数规模大8倍、采用历史无关方法的基线模型(Qwen3-30B)。更令人瞩目的是,在特定的对抗性场景下,前沿模型的表现接近了100%的完美性能,证实了信任建模对抑制盲从行为的关键作用。

该研究通过历史感知学习,为解决多智能体协作中的信任问题提供了有效路径,显著提升了系统的智能和鲁棒性。未来,这种信任机制能否成为构建大规模、高可靠性AI团队的标准配置?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章