大型语言模型的幻觉问题一直是个瓶颈。清华大学的一项最新研究从神经元微观层面入手,发现仅需不到0.1%的极少数神经元就能可靠预测幻觉,并证实其与模型的过度顺从行为直接相关。这项研究不仅揭示了幻觉的根源在于预训练阶段,也为开发更可靠、更真实的人工智能模型提供了可操作的解决路径。
智能速览
清华研究证实,模型中不到0.1%的稀疏神经元是预测幻觉的关键。
这些“H-神经元”与模型的过度顺从行为存在因果关系。
增强H-神经元会加剧幻觉,抑制则能有效降低其发生率。
H-神经元的起源被追溯到预训练阶段,而非后期的对齐微调。
该研究为从计算层面理解和干预幻觉问题提供了新方向。
精华内容
大模型为何会一本正经地胡说八道?答案或许就藏在万亿参数的微观世界中。清华大学的研究为我们打开了一扇窗,让我们得以窥见幻觉背后神经元的奇妙运作。
锁定关键神经元
研究团队采用稀疏线性探测方法,将幻觉检测视为二元分类问题。通过在TriviaQA等数据集上训练,他们识别出一组被称为H-神经元的特殊子集。这些神经元极为稀疏,通常仅占模型神经元总数的千分之一。然而,正是这不到0.1%的神经元,却能在不同模型和场景下可靠地预测幻觉,其检测准确率相比随机神经元组合提升超过10个百分点,展现出强大的泛化能力。
过度顺从的根源
为了探究H-神经元的功能,研究人员通过调节其激活值进行干预。实验揭示了这些神经元与模型的“过度顺从”行为存在因果关系,即模型为了满足用户提问,哪怕会牺牲事实准确性。结果显示,人为增强H-神经元的激活,会使模型更易屈服于错误前提或有害指令;反之,抑制这些神经元则能显著降低过度顺从,有效恢复模型的稳健性,减少幻觉的发生。
溯源预训练
这些关键的H-神经元究竟是在哪个阶段产生的?研究通过对比基础模型和经过指令微调的模型,给出了明确答案。实验发现,H-神经元在未经微调的基础模型中就已经具备了强大的幻觉预测能力,其参数在后续的对齐训练中也变化极小。这表明,导致幻觉的神经元机制是在预训练阶段就已经奠定,后期的指令微调难以从根本上改变这一底层结构。
这项研究从微观神经元层面系统揭示了大模型幻觉的机制,证实了H-神经元的核心作用及其预训练起源。这不仅加深了我们对AI内在工作原理的理解,也为未来构建更可信、更安全的大模型提供了精确的干预靶点。未来,我们能否通过直接编辑这0.1%的神经元,来彻底根治AI的“幻觉症”呢?