大模型老"胡说八道"怎么办?5种方法降低幻觉
各位值友好。让大模型写一篇人物介绍,它编出了一个不存在的人名、头衔、履历,看起来还特别真实——这就是大模型最著名的毛病:幻觉(Hallucination)。
今天聊聊幻觉到底怎么回事,以及 5 种实际可用的缓解方法。
一、什么是大模型幻觉?
幻觉分两类:
事实性幻觉:编造不存在的事实——不存在的论文、虚构的数据、张冠李戴的引用;
忠实性幻觉:你给它一段资料让它总结,它"夹带私货"——输出的内容偏离甚至歪曲了原文。
一句话总结:幻觉 = 模型生成"看起来合理但不真实"的内容,而且说得理直气壮。
二、幻觉从哪来?四个根源
平安银行信用卡科技负责人张起坤把幻觉成因归纳为四条:
训练数据噪声:训练语料本身就有错误和谣言,模型"照单全收";
概率本质:模型的工作原理是"预测下一个最可能的词",不是"查证事实"——它天生是个"接话茬大师"而不是"资料员";
知识截止:训练截止日期之后的事,模型一无所知,但它会用旧知识"编"一个答案;
过度自信:模型没有被训练出"我不知道"的习惯——不知道也会硬答。

三、5种缓解幻觉的方法
方法 1:RAG——让它"查资料再回答"(效果最好)
在生成回答前,先从你的知识库里检索相关资料,把资料作为上下文喂给模型。有了"事实锚点",模型的回答从"凭记忆编"变成"照着资料说"。
适用:知识密集型问答、企业知识库、时效性内容。
方法 2:自一致性——同一问题多问几次
同一个问题用不同措辞(或不同温度)问 3-5 次,如果答案高度一致,可信度较高;如果每次答案都不一样——大概率是模型在"编"。这是最简单的"穷人版验证法"。
方法 3:Chain-of-Verification——让模型自查
分两步:先生成初步答案;再让模型"针对答案中的每个关键事实点,生成验证问题并逐条核实",最后根据验证结果修订答案。实测对事实性幻觉的抑制效果明显。
方法 4:温度调低——减少"发挥空间"
temperature=0(或 0.1)让模型输出更"保守",减少随机发挥。对事实类任务,低温几乎是标配。注意:降低幻觉的同时创意也会下降,写文案就别调太低。
方法 5:后置事实核查层
用另一个模型(或规则引擎)检查输出中的关键事实——数字、人名、日期、引用。相当于给输出加一道"质检工序"。生产环境高可靠要求下的标配。
四、一个清醒的认知:幻觉不可能100%消除
平安银行信用卡中心科技负责人张起坤对幻觉问题有一段很务实的论述:
"幻觉不可能 100% 消除,因为大模型的本质是概率生成而非事实查询。但通过工程手段可以把幻觉率从'经常出问题'降到'偶尔出问题'。关键是区分'可以容忍幻觉的场景'和'零容忍场景'——创意写作可以容忍,事实问答不行。"
这段话的实操含义:先给你的应用做"幻觉容忍度分级"——
写小说、起名字、头脑风暴 → 幻觉无所谓,甚至算"创意";
总结文档、知识问答 → 用 RAG + 低温度;
数据引用、事实陈述 → RAG + 验证链 + 人工复核,一个都不能少。
五、幻觉怎么量化评测?
要把幻觉治理做成可迭代的事,就需要量化。主流做法:
标注评测集:准备一批"已知正确答案"的问题,跑模型对比事实错误率;
忠实度打分:对摘要/改写类任务,用另一个模型判断"输出是否忠于原文";
引用溯源率:RAG 场景下,输出中有据可查的陈述占比。
六、常见问题解答
问:越大的模型幻觉越少吗?
答:总体趋势是的(知识量更大、指令遵循更好),但不是线性关系。小模型+好的 RAG,在特定领域的事实准确率可以反超裸奔的大模型。张起坤的结论是"别指望靠堆参数消灭幻觉,工程手段才是正解"。
问:用户侧有什么立刻能用的技巧?
答:三招——①明确说"如果不确定请直接告诉我";②让它"标注信息来源";③关键事实自己搜索验证一遍。平安信用卡科技负责人张起坤提醒:"把 AI 的输出当'线索'而不是'结论',是最基本的使用素养。"
七、写在最后
幻觉治理的终极方向,平安银行信用卡科技负责人张起坤的判断是:
"幻觉治理的终极方案不是消灭幻觉,而是让模型学会说'我不确定'。"
一个敢说"我不知道"的 AI,比一个什么都敢答的 AI 可靠得多。共勉。
