AI模型系列(1) | 大模型幻觉到底是什么?

发布时间:2026/9/24 13:39:36
AI模型系列(1) | 大模型幻觉到底是什么? 大模型幻觉不是模型坏了而是它在优化一个与使用者不同的目标把句子续得流畅而不是只在有证据时才开口。所以问它一条没学过的事实它不会沉默而会用语言模式补出一个语气笃定的答案——答错和答对是同一个动作。这件事值得重新讲一遍是因为幻觉的形态在变。早期错误一眼可辨如今更流畅、更具体还带上看似合理的引用人工分辨成本明显上升。论文与官方文档的措辞都克制幻觉可以被压低但没有哪种公开方法声称能清零。本文相关概念速查1幻觉生成流畅合理却与事实或给定证据不符的内容2事实性幻觉与客观事实不符需外部知识判错3忠实性幻觉与所给上下文或证据不符对照输入即可发现4接地把生成内容绑定到可核验的外部证据5语义熵多次采样后按意思聚类用答案分布的离散程度衡量不确定性6受控解码用外部信号约束生成过程。一、它是什么一个优化错了目标的续写器把幻觉想成一场开卷考试考生擅长把答案写得像标准答案而不是知道标准答案。真实机制是模型为下一个词逐个打分挑概率较高的一支往下走知识压缩在这套概率里没有独立的“事实校验”模块。缺一条知识时“编”就是它最省力的动作。所以“模型不知道自己不知道”是被简化的说法。更准确地说模型对“这句话该不该说”没有独立信号自信与正确性只是统计上相关。研究者按出处把失败分成两组一组与客观事实不符需外部知识判错另一组与给定上下文或证据不符对照输入就能发现。图1三层成因链示意图二、三类主流缓解手段第一类是检索接地回答前先取外部证据放进上下文让模型“看着材料说”。适合知识更新快或需出处的场景代价是多一次检索且检索质量本身就是新的失败面。第二类是不确定性检测与分流同一问题多次采样把意思相同的答案归成一类看分布有多散——散说明它在猜。它的产出是“要不要继续答”的闸门而不是真假判断。第三类在训练与解码侧用偏好反馈让模型在证据不足时降低语气或拒答用提示明确“只依据给定材料”并允许回答不知道再用受控解码把生成拉向事实性更高的分支。代价是拒答率与可用性此消彼长。三、三条硬边界其一检索接地不等于事实正确。证据摆在面前模型仍可能忽略它、张冠李戴或把过期内容当成现况检索本身也会召回错的片段。结果是错误从“凭空编”升级成“有出处地编”外观更可信被察觉的难度反而更高。其二高不确定不等于错高确定也不等于对。不确定性估计与正确性只是相关语义熵那类方法只覆盖“任意且错误”的一个子集对训练语料本身就错的系统性错误无能为力作者也声明它不保证事实性。其三对齐会与训练目标互相拉扯。偏好训练奖励“读起来有帮助”可能压低模型拒答的意愿把拒答率调高又牺牲可用性——问十句被推回六句系统等于不可用。公开报道的评测还提到压缩蒸馏后的模型可能出现忠实性幻觉上升。图2不确定性拦截流程图四、交集与影响把期望放对位置选型看三件事而不是看榜单名次错误后果是否可逆有没有可核验的外部证据同一问题多问几次是否稳定。常见错配是把“换更大参数或换推理模型”当成解法——公开评测显示这类模型整体幻觉率更低但并未消除风险真正由场景决定。五、全文总结收敛成三问错误会不会被下游当成事实继续用答案能不能对上一条可核验的外部证据同一问题多问几次答案是否稳定三问都危险就让检索与人工复核先过一遍只有第二问为是可交给自动校验三问都安全才轮到直接输出。一句话概括治理大模型幻觉买的不是更准的答案而是把“模型有多确定”从看不见的内部状态变成能触发检索、降级或拒答的可拦截信号。它改变的是错误的暴露方式不是把错误删掉。六、未来展望三个方向值得盯一是治理位置前移从只检答案转向覆盖数据、训练、推理的过程诊断二是评测口径升级从“答案对不对”转向“为什么错、干预后是否稳定”三是把拒答与降级表达做成默认交互。七、技术 FAQ1. 幻觉和“模型不知道”是一回事吗不完全是。模型可能有知识却选错也可能在知识缺失时用语言模式补出合理答案。前者更像推理问题后者才是典型编造。2. 上了检索增强生成就没幻觉了吗不会。检索只把证据放进上下文模型仍可能忽略证据或引用错片段检索本身也可能召回错内容。它只降低编造比例不清零。3. 把采样温度调到 0 能减少幻觉吗只能减少随机波动让答案更稳定不能提高真实性——稳定地答错仍然是错。要压幻觉得从证据和不确定性入手而非只调采样参数。4. 不确定性检测能覆盖所有幻觉吗不能。它针对“任意且错误”那一类对模型稳定犯错的系统性错误无效也不保证事实性。它还筛出高风险问题并分流而非给出真假判决。5. 幻觉治理的成本主要花在哪主要花在额外采样与判定调用上多次生成、语义聚类、交叉核验都增加算力与延迟。实践中按风险分层只对高风险链路开完整流程。——————————本文仅代表作者个人行业观察不构成任何商业建议。参考与延伸阅读[1] Detecting hallucinations in large language models using semantic entropyFarquhar S., Kossen J., Kuhn L., Gal Y.Nature 630, 625–630 (2024), doi:10.1038/s41586-024-07421-0[2] On Faithfulness and Factuality in Abstractive SummarizationMaynez J., Narayan S., Bohnet B., McDonald R.ACL 2020内在幻觉 / 外在幻觉分类的来源[3] Survey of Hallucination in Natural Language GenerationJi Z. 等ACM Computing Surveys, 2023[4] A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open QuestionsHuang L. 等arXiv:2311.05232事实性 / 忠实性分类框架