一句话定义
幻觉(Hallucination)指模型生成「流畅但与事实不符或无依据」的内容;其根源在于下一词预测的优化目标与「真实正确」并不一致——自信地编造在统计上往往是合法的。
为什么重要
幻觉是 LLM 落地可信场景(医疗、法律、金融、事实问答)的第一障碍,也是大多数「AI 翻车」新闻的技术根源。理解其机制才能设计缓解方案(RAG、校准、检索引用),而不是停留在「AI 又胡说了」的朴素认知。
前置知识
- kp-016(对齐与诚实性训练)
核心概念
- 事实性幻觉:与客观事实冲突的陈述(人物、日期、引文、数字)。
- 忠实性幻觉:与给定材料(如用户提供的文档)不符的总结或引用,在摘要与 RAG 中高发。
- 过度自信 / 校准失准:模型输出的确定性与其正确率不匹配。
- 知识边界问题:模型不知道「自己不知道什么」,长尾知识尤其薄弱。
- RLHF 的放大效应:偏好数据偏爱「流畅、详尽、笃定」的回答,可能奖励了编造。
原理与机制
四层成因:一是目标错位——预训练优化似然,编造常见模式与复述错误信息都能得高分;二是知识局限——长尾事实在语料中出现极少,参数化记忆不可靠;三是解码随机性——采样会在低概率分支上走出事实错误路径;四是对齐偏置——被训练成「总是给答案」的模型宁可编造也不拒答。相应缓解分层:数据层(清洗与配比,见 kp-006)、训练层(诚实性偏好数据、拒答训练)、推理层(RAG 外挂知识源、要求引用出处)、系统层(对高风险输出做事实校验)。
公式或模型
校准的度量:期望校准误差(ECE)衡量「置信度与准确率的偏差」:
理想模型在各置信桶内 acc ≈ conf;幻觉高发模型的 conf 显著高于 acc。
图示
问: "某某 2019 年的论文标题是什么?"
模型内部: 该长尾事实参数记忆弱 → 下一词分布仍给出「高置信的合理样式」
输出: 一个格式完美、标题编造的"引用" ← 幻觉
缓解: 改为检索(RAG)→ 找不到 → 训练过的拒答策略 → "我不确定"
直观类比
像一位「从不认输的健谈者」:被问到不知道的事,他不会沉默,而是用最流利的语气现编一个听起来合理的答案——因为在他过去的「训练经历」里,流利作答从未被扣分。要让他可靠,得给他配一个可以随手翻阅的资料柜(RAG)并教他说「我不知道」。
实例或案例
经典翻车模式包括:编造不存在的论文与判例(法律场景被法院点名批评的案例屡见)、虚构 API 与函数名(编码场景)、编造历史人物语录。TruthfulQA(2022)专门测量「模仿人类常见错误说法」的倾向;行业缓解实践中,RAG + 引用出处 + 置信度提示("如不确定请说明")已成为高可信产品的标准组合(见 kp-029)。
常见误区
- 「幻觉 = 模型坏了」:它是当前范式目标的固有属性,只能压低概率不能归零。
- 「加大模型就消失」:规模提升降低常见事实错误率,但长尾编造依旧存在。
- 「温度调 0 就没有幻觉」:贪心解码只消除采样随机性,不解决知识错与目标错位。
与其他知识点的关系
自测题
- 从优化目标角度解释为什么幻觉难以根除。答案要点:预训练目标是似然而非真实;编造与复述错误在统计上合法,需外挂信号(检索/校验)补充。
- 事实性幻觉与忠实性幻觉的区别?答案要点:前者违反客观事实;后者违反给定材料内容(总结/RAG 引用失真)。
- 至少给出三层缓解手段并各举一例。答案要点:数据层(清洗去重)、训练层(诚实偏好与拒答训练)、推理层(RAG、引用出处、低风险措辞)、系统层(事实校验流水线)——任举三层即可。
延伸阅读
- Survey of Hallucination in Natural Language Generation(Ji 等,2023)
- TruthfulQA(Lin 等,2022)