幻觉
你问模型一本书的 ISBN 号,它给了你一个格式完美、校验位都对的号码——书是真的,号码是假的。你问一个法条的条款号,它答得斩钉截铁,你去查发现那一条讲的是别的事。这类现象有个专门的名字叫幻觉(hallucination)。这一节要做三件事:把「幻觉」这个词拆成两种完全不同的毛病、讲清它为什么在机制上必然发生、然后给一份能立刻用上的应对清单。本节尤其要澄清一个流传很广的误读:有一篇论文证明了「幻觉不可消除」,但那个证明有严格的形式化前提,把它读成「AI 永远不可能准确」是错的。所有论文都会给出 arXiv 编号并标明是否经过同行评议;所有数字都会绑定「哪个模型、哪个测试集」,绝不给你一个悬空的「幻觉率百分之几」。
想象医院里来了一个实习生。他书读得极多,问什么都能答,语气永远沉稳专业,从不结巴。带他的主任很快发现一个问题:这孩子从来不说「我不确定」。
问他某个罕见病的诊断标准,他张口就来,条理清晰、术语准确、听起来完全像教科书。主任去翻指南,发现其中一条压根不存在——那是他把两个相似疾病的标准糅在一起,自己「顺」出来的。
关键在于:这孩子不是在骗人。他没有「我知道真相但我要瞒着你」这种动机,他压根不知道那条是假的。他脑子里的机制是「按最像的样子接下去说」,而在绝大多数情况下,这个机制给出的答案是对的——所以他会一直用这个机制,包括在它出错的那些时候。
更要命的是主任后来想明白的一件事:是考试制度把他训练成这样的。医学考试是选择题,蒙一个有四分之一概率对,空着一定是零分。换成大白话:一个只算对题数、不扣错题分的评分方式,会稳定地培养出「什么都敢答」的考生。这不是品行问题,是激励问题。
先给「幻觉」一个准确的定义
「幻觉」这个词是从心理学借来的,但借得并不贴切,容易让人误以为模型「看到了不存在的东西」。所以先把学术界的准确说法摆出来。
目前中文世界引用最多、也最经得起查的一份定义,来自一篇综述:arXiv 2311.05232(Huang 等,标题 A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions,首版 2023-11-09,第二版 2024-11-19)。这篇的分量值得说清楚:它已被 ACM Transactions on Information Systems(TOIS)接收,是经过同行评议的期刊论文,不是自己传上去就完事的预印本。
按这类文献的说法,幻觉指的是模型生成了过度自信、看起来很合理、但实际为假的陈述(原文用词是 overconfident, plausible falsehoods)。这里三个形容词每一个都不能少:
- 过度自信模型不会在假话前面加「我猜」。它输出假话时的语气和输出真话时一模一样。说白了就是:你从语气上分辨不出来,这是幻觉最危险的地方。
- 看起来很合理幻觉不是胡言乱语。它编出来的 ISBN 校验位是对的,编出来的论文标题符合该领域的命名习惯,编出来的法条编号格式正确。相当于假钞——正是因为它长得像真的,才有欺骗性。
- 实际为假这是唯一的硬标准。判断幻觉必须靠外部核对,不能靠读起来顺不顺。
另外这篇综述特别提醒一件事:模型的这种现象与人类的感知体验(幻觉的原义)有根本区别。人产生幻觉是感官出了问题,模型这边压根没有感官。本质上就是一个借来的比喻词,用久了就被当成实质了。
幻觉不是一种病,是两种:内在与外在
这是本节第一个真正有用的区分,而且它直接决定你该用什么办法去治。arXiv 2311.05232 里的说法是,各家分类体系普遍会把幻觉沿着这条线切开:
第一种叫内在幻觉(intrinsic hallucination)。原文的界定是「与用户的提示直接矛盾」的内容。换成大白话:你在问题里已经把材料给它了,它答出来的东西跟你给的材料对不上。
综述里给的例子特别好懂,也特别打脸:问它「DEEPSEEK 这个词里有几个 D」,它回答「2」或者「3」。这题不需要任何外部知识——答案就摆在问题里,字母数一遍就出来了(是 1 个 D,如果只数大写首字母;这里的重点不是正确答案,而是模型给出的数字与眼前的字符串矛盾)。这类错误暴露的是模型处理字符级细节的机制缺陷,跟「知识不够」毫无关系。
第二种叫外在幻觉(extrinsic hallucination)。原文的界定是「与训练数据或外部现实矛盾」。说白了就是它说了一件世界上不成立的事——编造的论文、不存在的法条、张冠李戴的生卒年。
| 对比项 | 内在幻觉(intrinsic) | 外在幻觉(extrinsic) |
|---|---|---|
| 跟什么矛盾 | 跟你给它的提示 / 上下文矛盾 | 跟训练数据或真实世界矛盾 |
| 典型例子 | 让它总结一段你贴进去的文字,它总结出文中没有的观点;数一个词里有几个字母数错 | 编造一篇不存在的论文、给错一个人的任职年份 |
| 生活类比 | 学生抄题都抄错——卷子上写的是「甲」,他答题时当成「乙」在算 | 学生记错了课本内容——题读对了,但脑子里存的知识本身是错的 |
| 能不能自己发现 | 能。你手上就有原文,逐句比对即可 | 不能。必须去查外部资料 |
| 主要治法 | 让它引用原文原句、要求给出出处段落、把长文档拆小 | 检索增强(RAG)、要求给可点击的链接、人工核实 |
| 对应的评价指标 | faithfulness(忠实度):输出是否忠于输入上下文 | factuality(事实性):输出是否符合真实世界知识 |
最后那一行值得单独说,因为这两个英文词在中文资料里经常被混着译成「准确性」,一混就把问题搞糊了。faithfulness 衡量的是「有没有忠实于你给的上下文」,factuality 衡量的是「有没有符合客观事实」。这两件事可以各自独立地对或错——一段总结可以完全忠实于原文,但原文本身就是错的(faithful 但不 factual);也可以说了一件世界上确实成立的事,却完全不是你给的那份材料里说的(factual 但不 faithful)。
打个比方:你让秘书按会议录音整理纪要。faithfulness 问的是「纪要是否忠实于录音」,factuality 问的是「录音里说的话本身对不对」。秘书的职责只到第一层,第二层得开会的人自己负责。很多人对 AI 的失望,其实源于把这两层职责混在一起要求。
它为什么会这样?OpenAI 自己给的答案很朴素
2025 年 9 月,OpenAI 的研究者发了一篇专门讨论根因的文章:arXiv 2509.04664,标题 Why Language Models Hallucinate,作者是 Adam Tauman Kalai、Ofir Nachum、Santosh S. Vempala、Edwin Zhang,发布日期 2025-09-04。状态要说清楚:这是 arXiv 预印本,截至本文核实日(2026-08-08)尚未见到同行评议记录。但它的价值在于——这是造这些模型的机构自己给出的解释,而且解释得非常不玄乎。
论文的核心论断,原文是这么写的:We argue that language models hallucinate because the training and evaluation procedures reward guessing over acknowledging uncertainty.(我们主张,语言模型产生幻觉,是因为训练与评测流程奖励「猜」而不奖励「承认不确定」。)
还有一句更狠,直接把神秘感拆掉了:Hallucinations need not be mysterious — they originate simply as errors in binary classification.(幻觉不必被神秘化——它们的来源就是二分类里的错误。)以及:If incorrect statements cannot be distinguished from facts, then hallucinations in pretrained language models will arise through natural statistical pressures.(如果错误陈述无法与事实区分开,那么预训练语言模型中的幻觉就会因自然的统计压力而出现。)
换成大白话,这段话在说:模型在学的时候,本质上是在学「什么样的句子看起来像真的」。如果一句假话和一句真话在可观察的统计特征上没法区分开,那模型就学不出这个区别,于是必然会把一些假话当成合格输出。这不是 bug,是这套学习方式的必然产物。
论文的第二个论断更有实践意义,原文:Hallucinations persist due to the way most evaluations are graded — language models are optimized to be good test-takers, and guessing when uncertain improves test performance.(幻觉之所以持续存在,是因为大多数评测的打分方式——语言模型被优化成了「好的应试者」,而在不确定时去猜,会提高考试成绩。)
把 OpenAI 那篇的两个论断合起来,可以还原成一个所有人都体验过的场景:一场只算对题数、答错不倒扣分的选择题考试。
你是考生,剩下最后五分钟,还有八道题没做。你完全不会。请问理性的做法是什么?当然是全部随便填上——四选一,蒙对期望值是两道题;空着,期望值是零。在这个规则下,「什么都不填」是一个被制度惩罚的选择。
现在把角色换掉:模型是考生,各种排行榜(benchmark)是考卷,训练过程是刷题。排行榜的算分方式几乎都是「答对得分、答错不得分」——注意,答错和留空拿到的分是一样的,都是零。于是在这套规则下,「我不确定」这个答案永远劣于「随便给一个」。刷了几万轮之后,模型自然长成一个「什么都敢答」的性格。
这就解释了一个很多人纳闷的现象:为什么模型不能干脆学会说「我不知道」?因为在现行的评分体系里,说「我不知道」是要吃亏的。本质上就是:我们一边抱怨它爱瞎猜,一边用一套奖励瞎猜的尺子给它排名。
所以论文给的解决方向也不是技术性的,而是制度性的。原文用了「epidemic」(流行病)这个词:This 'epidemic' of penalizing uncertain responses can only be addressed through a socio-technical mitigation: modifying the scoring of existing benchmarks that are misaligned but dominate leaderboards, rather than introducing additional hallucination evaluations.(这种「惩罚不确定回答」的流行病,只能通过社会—技术层面的缓解来解决:改掉那些取向不当却主导排行榜的现有基准的打分方式,而不是再加几个幻觉评测。)翻译成人话:别再多造几把尺子,先把现有那把尺子的刻度改了。
怎么给幻觉「量体温」:四个基准与它们真实的数字
要谈幻觉严重不严重,就得能测。但「测幻觉」这件事本身极其麻烦,因为你得先有一份公认的正确答案。下面四个是被引用最多的测量工具,请特别注意每个数字后面绑的模型与测试集——离开这两个限定,这些百分数一文不值。
第一个:TruthfulQA。出处 arXiv 2109.07958(Lin、Hilton、Evans,首版 2021-09-08,第二版 2022-05-08),已发表于 ACL 2022 主会,经同行评议。它的构造方式很刁:原文说 The benchmark comprises 817 questions that span 38 categories, including health, law, finance and politics.(该基准包含 817 道题,覆盖 38 个类别,含健康、法律、金融与政治。)这些题专门挑那些人类社会里流传着错误共识的话题——也就是说,它测的不是「知不知道」,而是「会不会跟着大众一起错」。
这篇论文里有两个数字被引错的频率极高,务必记准:The best model was truthful on 58% of questions, while human performance was 94%.(最好的模型在 58% 的题目上作出了真实回答,而人类的表现是 94%。)58% 是当时最好的模型,94% 是人类——不是某个模型达到了 94%。中文互联网上流传的「GPT-3 在 TruthfulQA 上接近人类水平 94%」是把两个数字接错了线。
而且这篇的结论里有一句更反直觉的,原文:Models generated many false answers that mimic popular misconceptions. The largest models were generally the least truthful.(模型生成了许多模仿流行误解的错误答案。最大的那些模型通常是最不真实的。)说白了就是:在这个特定基准上,模型越大反而越容易跟着大众的错误共识走。这很好理解——参数更多意味着把训练数据里的模式学得更像,而训练数据里就充满了流传甚广的错话。
打个比方:一个把网上所有帖子都背下来的人,和一个只看过几本教科书的人,你问「饭后立刻吃水果是不是不好」,前者更可能给你一套流传很广但没有依据的说法。记性好不等于判断准。
第二个:HaluEval。出处 arXiv 2305.11747(Li 等,首版 2023-05-19,第三版 2023-10-23),已发表于 EMNLP 2023 主会长文,经同行评议。它给出的一个具体观测是:ChatGPT is likely to generate hallucinated content in specific topics by fabricating unverifiable information (i.e., about 19.5% responses).(ChatGPT 在特定主题上倾向于通过编造无法验证的信息来产生幻觉内容,约占 19.5% 的回答。)
这个 19.5% 必须连着限定条件一起记:它是 2023 年的 ChatGPT、在该论文设定的特定主题上、按该论文的判定方式得出的比例。拿它去说「大模型的幻觉率是 19.5%」是典型的数字滥用——不同模型、不同题型、不同年份,这个数会大幅变动。
第三个:FActScore。出处 arXiv 2305.14251(Min 等,首版 2023-05-23,第二版 2023-10-11),已发表于 EMNLP 2023 主会,经同行评议。它的思路很值得学,原文:FACTSCORE, a new evaluation that breaks a generation into a series of atomic facts and computes the percentage of atomic facts supported by a reliable knowledge source.(FActScore 是一种新评测,它把一段生成内容拆成一系列原子事实,再计算其中有多少比例能被可靠知识源支持。)
换成大白话:不给整段打一个模糊的分,而是把段落拆成一句句最小的事实断言,逐条去查有没有依据,最后算通过率。相当于财务审计不看「这份报表大体像不像」,而是一笔一笔核凭证。这个论文在人物传记生成任务上给出的数字是:ChatGPT 只拿到 58%(原文 ChatGPT only achieves 58%)。同样地,这是特定任务(人物传记)+ 特定模型 + 2023 年的结果。
| 基准 | arXiv 编号 | 同行评议状态 | 它测的是什么 | 论文里的关键数字(含限定) |
|---|---|---|---|---|
| TruthfulQA | 2109.07958 | ACL 2022 主会 · 是 | 817 题 / 38 类,专挑人类社会有错误共识的话题 | 当时最好的模型 58% 真实;人类 94%;最大的模型通常最不真实 |
| HaluEval | 2305.11747 | EMNLP 2023 长文 · 是 | 模型在特定主题上编造不可验证信息的比例 | 2023 年的 ChatGPT,约 19.5% 的回答含编造内容 |
| FActScore | 2305.14251 | EMNLP 2023 主会 · 是 | 把生成拆成原子事实,逐条核有无可靠来源支持 | 人物传记任务上,ChatGPT 仅 58% |
| 综述总纲 | 2311.05232 | ACM TOIS 已接收 · 是 | 不是基准,是分类体系与研究地图 | 提出 intrinsic / extrinsic 与 faithfulness / factuality 两组维度 |
「幻觉不可消除」这个证明,到底证明了什么
接下来是本节最需要小心处理的一块内容。因为它是被误传得最厉害的一条,而误传的方向恰好是让人绝望的方向。
事情本身是真的:确实有一篇论文给出了形式化论证。arXiv 2401.11817,标题 Hallucination is Inevitable: An Innate Limitation of Large Language Models(幻觉不可避免:大语言模型的一种固有局限),作者 Ziwei Xu、Sanjay Jain、Mohan Kankanhalli,来自新加坡国立大学,首版 2024-01-22,第二版 2025-02-13。状态必须交代:这是 arXiv 预印本,截至 2026-08-08 未见同行评议记录。
论文的核心结论原文如下(这段值得逐句读,因为限定条件全在里面):We formalize the problem and show that it is impossible to eliminate hallucination in LLMs. Specifically, we define a formal world where hallucination is defined as inconsistencies between a computable LLM and a computable ground truth function. By employing results from learning theory, we show that LLMs cannot learn all the computable functions and will therefore inevitably hallucinate if used as general problem solvers.
翻成中文:「我们将这个问题形式化,并证明在大语言模型中消除幻觉是不可能的。具体而言,我们定义了一个形式化世界,其中幻觉被定义为一个可计算的 LLM 与一个可计算的真实函数之间的不一致。借助学习理论的结论,我们证明 LLM 无法学习所有可计算函数,因此若被用作通用问题求解器,就不可避免地会产生幻觉。」
现在请注意那两处加粗的限定:「形式化世界」和「若被用作通用问题求解器」。这篇论文成立的前提全在这两句上。下面把该记住的限定条件列清楚——这五条不是我们加的免责声明,是从论文自身的表述里读出来的:
- 限定一 · 结论在一个「形式化世界」里成立论文自己构造了一个数学世界,在那里「幻觉」有一个精确的数学定义(可计算模型与可计算真值函数之间的不一致)。说白了就是:这是在一个规则被严格写死的棋盘上证出来的结论,不是对现实世界的实测。
- 限定二 · 依据是计算学习理论论证的支点是「LLM 学不完所有可计算函数」。相当于证明「一本再厚的字典也收不下所有可能拼出来的词」——这个结论是关于可能性空间大小的,不是关于某本字典质量好坏的。
- 限定三 · 从形式世界推到现实世界是「外推」作者写道:Since the formal world is a part of the real world which is much more complicated, hallucinations are also inevitable for real world LLMs.(由于形式世界是那个复杂得多的现实世界的一部分,因此现实中的 LLM 也不可避免会产生幻觉。)这一步是逻辑外推,不是严格的形式化证明。这个区别很重要,也是该论文最受争议的地方。
- 限定四 · 没有排除在受限任务上做到零幻觉证明针对的是「通用问题求解器」。它并未排除在一个范围划得足够窄的具体任务上把幻觉压到零的可能。打个比方:「没有万能钥匙」和「你家门锁配不出钥匙」是两句完全不同的话。
- 限定五 · 论文自己认为缓解措施有价值同一篇论文还讨论了「现有各类幻觉缓解手段的可能机制与效果」。如果作者认为一切努力都白费,这一部分压根不必写。
所以,正确的转述应该是这样的:
| 常见的错误转述 | 为什么错 | 可以站住的说法 |
|---|---|---|
| 「已证明 AI 永远不可能准确」 | 把「不能对所有问题都准确」偷换成「对任何问题都不准确」。这是全称与特称的混淆 | 「在该论文的形式化设定下,作为通用问题求解器的 LLM 无法保证对所有问题都不出错」 |
| 「科学家证明幻觉治不好,所以别指望改善」 | 论文自己在讨论缓解手段的机制与效果,等于承认改善空间存在 | 「不可完全根除,但可以显著缓解;缓解手段的研究仍有意义」 |
| 「这是一篇权威论文证明的定论」 | 它是 arXiv 预印本,未见同行评议记录;且从形式世界外推到现实世界这一步有争议 | 「一篇提出形式化论证的预印本,其外推步骤存在学术争议」 |
| 「所以 RAG、联网搜索都是徒劳」 | 论文说的是「不能保证零错误」,不是「无法降低错误率」 | 「这些手段能降低错误率,但不能承诺归零」 |
打个比方,也许是最贴切的一个:洗手不能消灭世界上所有细菌,这是事实;但这从来不是不洗手的理由。医院里的手部卫生规范存在的目的从来不是「无菌」,而是把感染概率压到一个可接受的水平。本节后面给的所有应对方法,都是这个性质的东西。
RAG 能不能消除幻觉?先分清「缓解」和「根除」
这是实践中被问得最多的一个问题,也是营销材料里被吹得最狠的一个点。先解释术语。
RAG(Retrieval-Augmented Generation,「检索增强生成」)说白了就是:回答之前先去资料库里查一遍,把查到的原文塞进提示里,再让模型基于这些材料作答。相当于把一场闭卷考试改成开卷考试——允许考生翻书。
开卷考试当然比闭卷强,但你上过学就知道:开卷考试照样有人答错。而且答错的方式有几种非常固定的套路,跟 RAG 的失败模式一一对应:
| 开卷考试的失败方式 | 对应的 RAG 失败模式 | 说明 |
|---|---|---|
| 翻错了章节,找的不是这道题的内容 | 检索质量不行 | 召回的资料与问题无关,或者相关的那份没被召回来。本质上就是:搜得不准,后面全白搭 |
| 书太厚,来不及翻完 | 上下文窗口有限 | 能塞进提示里的材料量有上限(这点可以回看 §8.3)。塞不进去的部分等于不存在 |
| 书翻到了正确那页,答题时还是按自己的印象写 | 模型忽略检索结果 | 这是最气人的一种:正确答案已经在上下文里了,模型仍然照着它「记得」的说。这属于前面讲的内在幻觉 |
| 书本身印错了 | 知识库本身有错 | RAG 只保证「忠于检索到的材料」,不保证材料是对的。这是 faithfulness 与 factuality 的又一次分离 |
关于这一点,两篇文献的表述可以直接引用。arXiv 2311.05232(那篇 ACM TOIS 综述)里写的是:we delve into the current limitations faced by retrieval-augmented LLMs in combating hallucinations, offering insights for developing more robust IR systems.(我们深入探讨了检索增强的大语言模型在对抗幻觉时面临的现有局限,为构建更稳健的信息检索系统提供思路。)注意它用的词是 limitations(局限)——一篇同行评议综述认为这里存在局限,而不是问题已解决。
而 OpenAI 那篇 arXiv 2509.04664 说得更直接:其结论It applies broadly, including to reasoning and search-and-retrieval language models.(其适用范围很广,包括推理型模型和带搜索与检索的语言模型。)也就是说,「奖励猜测的评分制度」这个根因,并不因为接上了检索就消失。
所以准确的结论是:RAG 是缓解手段,不是根除手段。本节核实过程中特意找过「RAG 能把幻觉降低多少」这类量化声明,结论是:没有找到任何绑定了具体模型与具体测试集的权威量化声明——所以本文不给这个数字。你在营销材料里看到的「降低 XX% 幻觉」,请务必先问一句:哪个模型、哪个数据集、怎么判定的。
为什么它对「有几个字母」这种小事都会错
很多人第一次对大模型失去信任,不是因为它编了篇论文,而是因为它连「strawberry 里有几个 r」都能数错。这件事之所以让人震惊,是因为它太简单了——一个能写代码、能解方程的东西,怎么会数不清字母?
这属于前面讲的内在幻觉,而它的成因跟「知识不够」完全无关,得回到 §8.1 讲过的分词。模型看到的不是一个个字母,而是一个个 token(词元)。如果印象模糊了:token 就像乐高积木,句子是一块块拼出来的,而每一块可能是一个字、几个字母、甚至一个完整的词。
打个比方:让你数一个词有几个字母,你是逐个字母看的。但模型拿到的可能是三块积木,每块上面已经印好了一小段字母组合,而它看到的是「这三块积木的名字」,不是积木上印的每一个字符。这就像让一个人隔着信封数信里有几个字——他能猜个大概,因为他知道这类信通常多长,但他没法真的数。
综述 arXiv 2311.05232 举的那个例子(问 DEEPSEEK 里有几个 D,模型答 2 或 3)就是这一类。它的诊断价值很高:这道题的全部信息都在提示里,不需要任何外部知识,所以答错只能说明处理机制出了问题,而不是知识库出了问题。
实践上的启示很具体:凡是涉及逐字符操作的活儿——数字符数、判断回文、精确的字符串替换、严格的格式校验——都不要指望模型心算。让它写一段代码去做,或者你自己用编辑器的查找功能做。这不是模型笨,是你用错了工具,就像拿汤勺去量体温。
上面这个小工具可以让你亲手看到「模型眼中的句子」被切成了什么样子。你会发现同一句话在不同切法下块数不同,而且英文单词经常被切成好几块——那些切割点就是「数不清字母」这件事发生的地方。
哪些场景幻觉风险最高:一张分级表
幻觉的发生概率不是均匀的。它在某些类型的问题上高得离谱,在另一些上低到几乎可以忽略。搞清这张分布图,比记住任何一个百分数都有用——因为它直接告诉你什么时候可以放心用、什么时候必须逐字核。
规律其实一句话就能概括:越是「有唯一正确答案、且这个答案是一串精确符号、且训练数据里出现次数很少」的东西,越容易被编出来。
| 风险等级 | 典型问题类型 | 为什么是这个等级 | 你该怎么办 |
|---|---|---|---|
| 极高 | 具体的编号与标识:论文 DOI、书的 ISBN、法条条款号、案件案号、专利号、API 的具体参数名、软件的具体版本号 | 这些是高精度、低冗余的字符串。改一位就完全错,而且它们在训练数据里出现频率低,模型只能「按格式编一个」 | 一律逐条核。把它当成「待验证的线索」,不是答案 |
| 极高 | 引文与出处:「某某研究表明」「某本书第几页说」 | 格式极容易模仿,内容极难验证。这是学术圈和法律圈已经出过真实事故的地方 | 要求给可点击链接,然后真的点开看。点不开的一律作废 |
| 高 | 冷门人物的生平、小机构的历史、地方性的具体规定 | 训练数据里这类内容稀少,模型倾向于用同类模式「补全」 | 换成有官方页面的信源自己查 |
| 高 | 数字精确度要求高的事实:具体金额、具体日期、具体百分比 | 数字的「合理外观」极容易伪造,而且看起来无法从语气分辨 | 只信有出处的数字。这正是本站所有数字都带日期与出处的原因 |
| 中 | 逐字符操作:数字母、判断回文、精确替换 | 属内在幻觉,成因是分词机制(见上一节) | 让它写代码来做,或者你自己用工具做 |
| 中 | 长文档总结、多份材料对比 | 材料一多就容易串台,这是 faithfulness 类问题 | 要求每个结论后面附原文引句,便于你抽查 |
| 较低 | 改写、润色、翻译、调整语气、格式转换 | 因为答案就在输入里,不需要它从记忆中调取事实 | 正常用即可,抽查语义有没有走形 |
| 较低 | 头脑风暴、起草提纲、给多个备选方案 | 这类任务压根不要求唯一正确答案,「编」在这里恰恰是优点 | 放心用。这是当前 AI 性价比最高的用法之一 |
| 较低 | 写代码骨架、写测试、解释报错信息 | 因为代码有编译器和测试来当裁判——错了会立刻暴露,不会静默地错下去 | 照常用,但别跳过运行和测试这一步 |
这张表里最值得记住的是最后一行的原理,它可以推广成一条通用判断法则:一个任务如果自带「快速验证机制」,那幻觉的危害就被大幅削弱了。
打个比方:让人帮你做菜,如果你能马上尝一口,那他手抖放多了盐你立刻知道;如果这道菜要冷冻起来一个月后端上宴席,那就危险了。代码有编译器,就是那口「马上能尝」;而一个 ISBN 号,你不去查就永远尝不出咸淡。
八条能立刻用上的应对方法
下面是本节最实用的部分。这些方法都不需要你懂技术,全部是提问方式和使用习惯上的调整。
- 一 · 明确授权它说「不知道」前面讲过,模型的「什么都敢答」性格来自不倒扣分的评分制度。你可以在提示里手动改一下这个规则:「如果你不确定,请直接说不确定,不要猜;给出不确定的答案会被视为错误。」相当于考前老师说一句「这次答错要倒扣分」——考生的行为立刻就变了。这是性价比最高的一招。
- 二 · 把「回忆」改成「阅读」别问「XX 法的第几条是什么」,而是把法条原文贴进去,然后问「根据以上材料回答」。说白了就是把闭卷改成开卷。这一招把问题从外在幻觉(难查)降级成内在幻觉(你手上有原文,能对照)。
- 三 · 要求「先给原文引句,再给结论」规定输出格式为「引句 → 结论」,而不是「结论 →(可选的)引句」。顺序很关键:先写结论再找依据,人和模型都会为了圆结论而挑材料;先摊材料再下结论,材料就成了约束。相当于报销时要求先贴发票再填金额。
- 四 · 所有编号、出处、链接一律当「线索」而非「答案」这条最重要。模型给的 DOI、ISBN、案号、URL,请一律假定为「疑似」,去权威站点验证后才能用。真实世界已经因为这条出过事:有人把编造的引文交进正式文书里。核实成本远低于事后代价。
- 五 · 同一个问题问两遍,用不同的问法如果两次答案在关键事实上不一致,那至少有一次是错的,说明这个点不可靠。打个比方:这就是医院里的「第二诊疗意见」——不是不信第一个医生,是给自己加一道校验。注意:两次答案一致也不能证明它是对的(模型可能稳定地错),但不一致几乎一定意味着有问题。
- 六 · 让它列出「我的哪些说法需要你去核实」直接追问:「上面这段回答里,哪些内容你的确定性较低、建议我另行核实?」模型往往能相当准确地标出脆弱点。相当于让施工队自己交一份「哪些地方我拿不准」的清单——问了总比不问强。
- 七 · 高风险场景一律走「双轨」涉及医疗、法律、财务、安全的内容,把 AI 的输出当作草稿和检索线索,最终结论必须由有资质的人或官方文本确认。本质上就是:AI 负责帮你把书翻到大概那一页,翻到之后还得你自己读。
- 八 · 用带出处的检索型工具做事实类查询对纯事实问题,优先用会给出可点击引用来源的工具,并真的点开核对引用是否支持那句话。这里有个常见陷阱:有引用不等于引用能支持结论——链接是真的,但链接里那篇文章可能压根没说这句话。
这八条里,第一条和第四条如果只能记两条,就记这两条。一条改变模型的行为,一条改变你的行为。
一个需要澄清的伦理问题:它算「说谎」吗
这个问题看着像哲学讨论,其实很实用——因为你怎么定性它,直接决定你怎么对待它的输出。
说谎这件事有一个必要条件:说话的人知道真相,并且故意说了反的。缺了「知道真相」这一环,就不叫说谎,叫说错。打个比方:一个记错了路的人给你指错方向,和一个故意把你指到反方向的人,做的事一样,性质完全不同。
按 OpenAI arXiv 2509.04664 的框架,幻觉的产生机制被描述为「二分类里的错误」加上「统计压力」——这里面没有任何位置留给「意图」。所以把幻觉说成「AI 在骗人」,在机制上是不成立的描述。
但要小心不要走到另一个极端:「它没有恶意」不等于「后果不严重」。一个把药量说错的人,无论有没有恶意,病人受到的伤害是一样的。所以这个澄清的实际用途只有一个:让你把注意力从「AI 值不值得信任」这个空泛的道德问题,转到「在这个具体任务上它的错误率有多高、我怎么设一道验证关卡」这个可操作的工程问题。
顺带说一件本节没能做到的事:本文没有取得任何厂商官方公布的「本模型幻觉率为 X%」的权威数字,因此正文里一个这类数字也没给。这不是遗漏——脱离测试集的幻觉率本身就是一个没有意义的数字,给出来只会制造虚假的确定感。你在宣传材料里看到这类数字,请一律先问:在哪个基准上、什么判定标准、哪个版本的模型。
幻觉是一个借来的词,指的是模型输出了「过度自信、看起来合理、但实际为假」的内容(arXiv 2311.05232,ACM TOIS 已接收,同行评议)。它分两种:内在幻觉与你给的提示矛盾,外在幻觉与真实世界矛盾。对应两个指标:faithfulness(是否忠于上下文)与 factuality(是否符合事实)。这两件事可以各自独立地对或错,混在一起谈就永远说不清。
成因不神秘。OpenAI 的 arXiv 2509.04664(预印本,未见同行评议)给的解释是:训练与评测的打分方式奖励猜测、不奖励承认不确定;模型被优化成了「好的应试者」,而在一场不倒扣分的考试里,蒙一个永远优于留空。所以论文提出的方向是改基准的打分方式,而不是再多加几个幻觉评测。
四个基准的数字要连限定一起记:TruthfulQA(arXiv 2109.07958,ACL 2022)——当时最好的模型 58%、人类 94%,且「最大的模型通常最不真实」;HaluEval(arXiv 2305.11747,EMNLP 2023)——2023 年的 ChatGPT 约 19.5% 回答含编造内容;FActScore(arXiv 2305.14251,EMNLP 2023)——人物传记任务上 ChatGPT 仅 58%。离开「哪个模型 + 哪个测试集 + 哪一年」,这些百分数一文不值。
「幻觉不可消除」有严格前提。arXiv 2401.11817(预印本,未见同行评议)的结论成立于一个形式化世界,前提是把模型当作通用问题求解器;从形式世界到现实世界那一步是外推,存在争议;它没有排除在受限任务上做到零幻觉,作者自己也在讨论缓解手段的效果。把它读成「AI 永远不可能准确」是全称与特称的混淆。
RAG 是缓解不是根除。开卷考试仍会答错,四种失败方式:检索不准、窗口装不下、检到了却不用、知识库本身有错。综述用的词是 limitations,OpenAI 明确说其结论也适用于检索增强模型。本文未取得任何绑定模型与测试集的「RAG 降低 XX% 幻觉」权威量化声明,故不给该数字。
最后落到能做的事上:明确授权它说「不知道」;把「回忆」改成「阅读」(贴原文);要求先给引句再下结论;所有编号、出处、链接一律当线索去核,不当答案用;同一问题换问法问两遍;让它自报哪些点需要核实;高风险领域走双轨;用带引用的工具并真的点开验证。洗手消灭不了所有细菌,但这从来不是不洗手的理由。