能力评估与局限 核心 约 20 分钟 更新 2026-10-02

幻觉:成因机制与缓解路径

学习状态:
未学

一句话定义

幻觉(Hallucination)指模型生成「流畅但与事实不符或无依据」的内容;其根源在于下一词预测的优化目标与「真实正确」并不一致——自信地编造在统计上往往是合法的。

为什么重要

幻觉是 LLM 落地可信场景(医疗、法律、金融、事实问答)的第一障碍,也是大多数「AI 翻车」新闻的技术根源。理解其机制才能设计缓解方案(RAG、校准、检索引用),而不是停留在「AI 又胡说了」的朴素认知。

前置知识

核心概念

原理与机制

四层成因:一是目标错位——预训练优化似然,编造常见模式与复述错误信息都能得高分;二是知识局限——长尾事实在语料中出现极少,参数化记忆不可靠;三是解码随机性——采样会在低概率分支上走出事实错误路径;四是对齐偏置——被训练成「总是给答案」的模型宁可编造也不拒答。相应缓解分层:数据层(清洗与配比,见 kp-006)、训练层(诚实性偏好数据、拒答训练)、推理层(RAG 外挂知识源、要求引用出处)、系统层(对高风险输出做事实校验)。

公式或模型

校准的度量:期望校准误差(ECE)衡量「置信度与准确率的偏差」:

ECE = Σ_b (|B_b|/N) · |acc(B_b) − conf(B_b)|

理想模型在各置信桶内 acc ≈ conf;幻觉高发模型的 conf 显著高于 acc。

图示

问: "某某 2019 年的论文标题是什么?"
模型内部: 该长尾事实参数记忆弱 → 下一词分布仍给出「高置信的合理样式」
输出: 一个格式完美、标题编造的"引用"          ← 幻觉
缓解: 改为检索(RAG)→ 找不到 → 训练过的拒答策略 → "我不确定"

直观类比

像一位「从不认输的健谈者」:被问到不知道的事,他不会沉默,而是用最流利的语气现编一个听起来合理的答案——因为在他过去的「训练经历」里,流利作答从未被扣分。要让他可靠,得给他配一个可以随手翻阅的资料柜(RAG)并教他说「我不知道」。

实例或案例

经典翻车模式包括:编造不存在的论文与判例(法律场景被法院点名批评的案例屡见)、虚构 API 与函数名(编码场景)、编造历史人物语录。TruthfulQA(2022)专门测量「模仿人类常见错误说法」的倾向;行业缓解实践中,RAG + 引用出处 + 置信度提示("如不确定请说明")已成为高可信产品的标准组合(见 kp-029)。

常见误区

与其他知识点的关系

自测题

  1. 从优化目标角度解释为什么幻觉难以根除。
    答案要点:预训练目标是似然而非真实;编造与复述错误在统计上合法,需外挂信号(检索/校验)补充。
  2. 事实性幻觉与忠实性幻觉的区别?
    答案要点:前者违反客观事实;后者违反给定材料内容(总结/RAG 引用失真)。
  3. 至少给出三层缓解手段并各举一例。
    答案要点:数据层(清洗去重)、训练层(诚实偏好与拒答训练)、推理层(RAG、引用出处、低风险措辞)、系统层(事实校验流水线)——任举三层即可。

延伸阅读