当前多模态大模型的社会理解能力评估存在局限,大多只关注社交推理。CMU提出的SOCIAL CAPTION框架,创新性地从社交推理、整体分析和定向信息提取三个维度进行综合评估,为更全面地衡量模型在真实社交场景中的表现提供了新方案。
智能速览
现有评估方法多聚焦于社交推理,忽略了整体与定向社交分析能力。
SOCIAL CAPTION框架从社交推理、整体分析和定向信息提取三个维度构建评估体系。
该框架结合人类标注与MLLM评判,确保评估的系统性。
研究已选取包括InternVL3和Gemini在内的10个主流模型进行测试。
精华内容
为了更全面地衡量模型的社会理解力,该研究构建了全新的评估框架,并进行了严谨的实验验证。
评估之困
当前,多模态大语言模型(MLLMs)在辅助机器人等社交场景的应用日益增多,但其社会理解能力的评估却存在明显短板。现有的评估方法大多集中于单一维度的社交推理,即判断特定社交行为背后的原因。然而,这种评估忽略了模型对整个社交场景进行整体描述的能力,也无法衡量其从复杂语境中定向提取关键社交信息的能力,导致评估结果无法全面反映模型的真实水平。
三维评估法
为解决上述问题,该研究提出了名为SOCIAL CAPTION的全新评估框架。该框架基于互动理论,构建了三个核心评估维度:首先是社交推理(SI),沿用传统方法,测试模型对社交行为原因的推断准确性;其次是整体社交分析(HSA),要求模型生成对整个社交场景的全面描述,评估其宏观把握能力;最后是定向社交分析(DSA),考察模型从场景中提取特定社交信息的能力。研究通过结合人类标注与MLLM自动评判,确保了评估的系统性。
模型大比拼
为验证该框架的有效性,研究团队选取了包括InternVL3和Gemini系列在内的10个主流多模态模型进行测试。实验设计十分严谨,通过设置有无转录文本的对比条件,来探究语音信息对社交理解的影响。同时,研究还采用标准化评分量表,系统分析了模型规模、架构设计以及语音语境等多个变量对最终评估结果的影响,为未来模型优化提供了数据支持。
SOCIAL CAPTION框架为多模态模型的社会理解能力评估提供了更全面的视角。随着该领域的深入,未来的模型能否在复杂社交互动中表现得更加“通情达理”?这为人工智能的发展提出了新的思考方向。