张大妈

港中文:为什么CoT救不了社交推理?

源自小红薯:每日ComputerScience

02-04 21:01

当前的心理状态评测多停留在被动理解层面,而真实社交互动更强调主动引导。一项新研究提出了“SocialMindChange”评测基准,首次系统性地考察大模型如何在群体对话中,通过策略性发言来引导他人心理轨迹,揭示了现有模型在高级社交智能上的显著差距。

港中文:为什么CoT救不了社交推理?智能速览

  • 评测重点从“理解心理”转向“引导心理”,考察模型的主动社交影响能力。

  • 构建了四人角色、五阶段连续互动的复杂社交场景,模拟真实群体压力。

  • 引入二阶、三阶等高阶心理状态标注,更贴近真实推理深度。

  • 设计了从“下一句该说”到“长期规划”的四类递进式评测任务。

  • 构建了包含近十万道题的规模化高质量数据集,远超现有基准。

港中文:为什么CoT救不了社交推理?精华内容

如何让AI真正理解社交,不只是“读懂”,更是“引导”?一项新研究为此构建了全新评测体系。

核心转变

传统的Theory of Mind(ToM)基准主要测试模型被动理解他人心理状态的能力,但这与真实社会互动的需求存在差距。新提出的“SocialMindChange”基准将焦点从“追踪心理”转向“引导心理”,核心目标是评估模型能否通过合适的对话,主动将目标人物的心理状态引导至预设的预期结果,这是对模型主动社交影响能力的首次系统性评测。

复杂场景

为了模拟真实的社会互动,该基准构建了极为复杂的场景。每个场景都包含4个不同角色,并跨越5个连续的时间阶段进行互动。这种设计能够显式地建模现实世界中的群体压力、个体间的竞争关系以及旁观者效应等多种社会动态,为模型提供了高度仿真的测试环境,远超以往的简单对话评测。

高阶心智

该评测体系的一个关键创新是引入了高阶心理状态的标注。它不仅覆盖了角色的信念、情绪、意图和行动,还明确标注了二阶(如“我认为你认为…”)乃至三阶的ToM推理。这种对深层心理链的考察,迫使模型必须理解更复杂的间接信息和潜在意图,而不是停留在表面的一阶信念推断,极大地提升了评测的深度和难度。

四级评测

评测任务被设计为四个递进式层级,逐步深入。第一层是“Guidance–Action”,即决定下一句该说什么;第二层是“Transition-1”,预测这句话会立刻引发哪些心理变化;第三层是“Transition-2”,要求解释为什么会产生这种变化;第四层是“Transition-3”,要求进行跨五个阶段的整体引导规划。这套任务体系从具体行动到抽象规划,全面评估了模型的社交策略能力。

数据规模

“SocialMindChange”不仅在评测维度上有所创新,在数据规模上也远超现有基准。整个数据集共包含1200个社会阶段、6000个精心设计的场景,以及由此生成的96000道多选题。如此规模化的高质量数据,为训练和评测更高级的社交智能模型提供了坚实基础,也确保了评测结果的可靠性和统计显著性。

“SocialMindChange”基准为评测AI的主动社交智能提供了新维度,其重要性不在于得出分数,而在于清晰指明了当前大模型与人类真实社交能力间的鸿沟。未来,如何让AI不仅能共情,更能进行有策略的正面影响,将是通往通用智能的关键一步。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章