OpenAI揭秘AI最大难题:语言模型为何总爱“胡编乱造”?OpenAI呼吁全面改革评价体系,避免自信错误被“鼓励”
OpenAI近日发布最新研究报告,直面当前人工智能领域广受关注的“语言模型幻觉(hallucination)”问题。所谓“幻觉”,是指模型生成看似合理却错误的答案,并且常常带有极高的自信度。即便面对简单直接的问题,如研究者Adam Tauman Kalai的博士论文标题或生日,主流聊天机器人依旧可能自信给出多个版本,但全都不对。
报告指出,幻觉的根源在于训练与评估机制的偏差。当前主流的评估方法更倾向于奖励“猜测”,而不是诚实地承认“不知道”。类似于多选考试,空题必然得零,而乱猜还有机会加分。因此,模型在排行榜上看似表现更优,却导致错误率——也就是幻觉现象——更为频繁。

数据验证了这一点:较旧的模型虽然准确率略高,但错误率却远高于那些会在不确定时选择“回避”的模型。OpenAI建议,未来应在评估体系中加大对“自信错误”的惩罚力度,同时鼓励模型在不确定时表达“我不知道”,并给予部分分数。这一思路借鉴了教育领域的负分制,也契合OpenAI所强调的“谦逊”价值观。
研究还强调,幻觉与训练机制密切相关。大语言模型依靠“下一个词预测”进行学习,擅长生成流畅语言,却缺乏“错误示例”来学习真假辨别。常见规律(如拼写)能被掌握,但随机性或低频的事实信息(如生日)难以归纳,导致幻觉不可避免。
报告总结道:
幻觉无法通过单纯提升准确率彻底消除,因为部分问题本身无解;
幻觉并非天生必然,模型可通过回避来降低风险;
小模型有时更懂“知之为知之”,反而比大模型更能避免自信出错;
当前幻觉的高发,本质上是错误激励机制的产物。
OpenAI表示,其最新模型已显著降低幻觉率,未来将持续优化,以减少模型在不确定时依旧给出“自信错误答案”的概率。
💬 讨论话题:你是否能接受AI在回答问题时直接说“我不知道”?还是更希望它冒险给出一个可能正确的答案?
