资讯

OpenAI揭秘AI最大难题:语言模型为何总爱“胡编乱造”?OpenAI呼吁全面改革评价体系,避免自信错误被“鼓励”

2025-09-08 10:24:17 0点赞 0收藏 0评论

OpenAI近日发布最新研究报告,直面当前人工智能领域广受关注的“语言模型幻觉(hallucination)”问题。所谓“幻觉”,是指模型生成看似合理却错误的答案,并且常常带有极高的自信度。即便面对简单直接的问题,如研究者Adam Tauman Kalai的博士论文标题或生日,主流聊天机器人依旧可能自信给出多个版本,但全都不对。

报告指出,幻觉的根源在于训练与评估机制的偏差。当前主流的评估方法更倾向于奖励“猜测”,而不是诚实地承认“不知道”。类似于多选考试,空题必然得零,而乱猜还有机会加分。因此,模型在排行榜上看似表现更优,却导致错误率——也就是幻觉现象——更为频繁。

OpenAI揭秘AI最大难题:语言模型为何总爱“胡编乱造”?

数据验证了这一点:较旧的模型虽然准确率略高,但错误率却远高于那些会在不确定时选择“回避”的模型。OpenAI建议,未来应在评估体系中加大对“自信错误”的惩罚力度,同时鼓励模型在不确定时表达“我不知道”,并给予部分分数。这一思路借鉴了教育领域的负分制,也契合OpenAI所强调的“谦逊”价值观。

研究还强调,幻觉与训练机制密切相关。大语言模型依靠“下一个词预测”进行学习,擅长生成流畅语言,却缺乏“错误示例”来学习真假辨别。常见规律(如拼写)能被掌握,但随机性或低频的事实信息(如生日)难以归纳,导致幻觉不可避免。

报告总结道:

  • 幻觉无法通过单纯提升准确率彻底消除,因为部分问题本身无解;

  • 幻觉并非天生必然,模型可通过回避来降低风险;

  • 小模型有时更懂“知之为知之”,反而比大模型更能避免自信出错;

  • 当前幻觉的高发,本质上是错误激励机制的产物。

OpenAI表示,其最新模型已显著降低幻觉率,未来将持续优化,以减少模型在不确定时依旧给出“自信错误答案”的概率。


💬 讨论话题:你是否能接受AI在回答问题时直接说“我不知道”?还是更希望它冒险给出一个可能正确的答案?

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松