随着大语言模型(LLM)能力增强,其替代人类参与者的趋势日益明显。然而,一项发表在Nature子刊的研究揭示了这一做法背后潜藏的巨大风险:LLM在模拟不同身份群体时存在系统性偏差,可能导致对边缘化群体的误传与伤害,为AI伦理敲响了警钟。
智能速览
LLM对身份群体的描绘更接近外群体的想象,而非内群体的真实体验。
模型的应答多样性远低于人类,会“扁平化”群体内部的差异性。
身份提示可能导致模型将身份简化为固定的、本质化的特征。
这些核心局限源于当前LLM的训练范式,难以根除。
精华内容
这项研究不仅指出了问题,更深入剖析了LLM在替代人类参与者时产生的三大核心危害,并探讨了其背后的成因与可能的缓解方案。
误传群体特征
研究发现,LLM在应答身份依存问题时,其表现出的视角更接近外群体对该群体的模仿,而非内群体的真实表达。例如,在描述“作为某一身份成员的感受”时,模型给出的答案充满了刻板印象。这主要因为其训练数据中作者身份信息与文本内容是脱钩的,模型学不到真实、多元的群体声音。
这种误传会直接导致边缘化群体的真实处境被忽略甚至扭曲。研究提出,使用“身份编码名字”进行提示,能在一定程度上缓解这一问题,让模型的描绘更贴近内群体。
扁平化多样性
另一个核心局限是LLM应答的“扁平化”。与人类参与者相比,无论模型被赋予何种身份,其回答的多样性都显著更低。模型倾向于给出最“平均”、最可能符合某种身份的答案,而忽视了群体内部巨大的个体差异。
这源于训练语言模型常用的交叉熵损失函数,它本质上会惩罚低概率的、更具创造性的输出。这种单一化的输出危害在于,它会强化“某个群体都一样”的错误认知,抹杀个体独特性。研究指出,适当提高模型的温度超参数,可以增加输出的随机性,从而缓解单一化问题。
本质化身份属性
第三个危害是“本质化”,即模型将身份标签简化为一套固定、先天的特征。当使用“作为一名[身份]的人,你认为…”这类提示时,模型会基于其在数据中学到的关联,给出僵化的回答,从而强化社会对特定群体的刻板印象。
这种做法的危害在于,它暗示了身份差异是天生且不可改变的,忽略了社会文化因素的复杂影响。研究建议,可以尝试用行为角色、政治倾向等非敏感维度来替代身份提示,引导模型从更具体的行为而非抽象的身份出发进行思考。
该研究用扎实的证据警示我们,在拥抱LLM带来的效率时,必须警惕其对社会公平构成的潜在威胁。简单地用模型取代人类,可能会无意中加剧偏见。如何负责任地使用AI,确保技术进步惠及每一个人,是开发者与使用者需要共同面对的课题。