Chapter · 13

第 13 章 · 局限与风险

The Limits · 知道边界在哪,才能用得更好

前面十二章基本都在讲「它能做什么」。这一章要认真讲「它做不到什么、以及做错的时候会错成什么样」。但请先记住这一章的基调:这不是一章劝你别用 AI 的内容,恰恰相反——它是一章教你把 AI 用得更放心的内容。打个比方:驾校教的不只是踩油门,还要教你刹车距离、盲区在哪、雨天多久打滑。学会这些不是为了让你别开车,是为了让你敢上路。这一章的每一节都遵循同一个结构:先把风险讲透、讲出限定条件,再给可操作的应对方法。另外这一章有一个别的章节没有的特殊要求——本章涉及大量法律与安全内容,所有法律部分都会写清司法辖区与案件当前状态,并且必须先声明一句:本文不构成法律建议。

重要声明

本章不构成法律建议。§13.3 提到的所有诉讼与法规,仅为截至 2026 年 8 月 8 日的公开司法记录与官方文本转述,用于帮助你理解「争议焦点在哪里」,不能作为任何具体行为的合法性依据。案件状态随时变化,法律在不同国家和地区(司法辖区)差别极大。真要做决定,请咨询你所在辖区的执业律师。

生活场景
🔪 一把很好用的菜刀

你家厨房里有一把很锋利的刀。它切菜又快又整齐,是你做饭效率的一半。现在问:这把刀「危险」吗?

答案取决于你怎么问。如果问「它会不会伤人」,会。如果问「所以应该扔掉吗」,显然不应该。正确的问题是第三个:一把刀有哪几种典型的伤人方式,以及分别怎么防。

厨房里其实早就有一整套成熟答案:切菜时手指要弯成猫爪(防切到指甲盖)、刀不能刀口朝上放在水槽里(防伸手进去摸到)、递刀要递刀柄(防对方接到刀刃)、切生肉和切熟食分两块板(防交叉污染)。你看,这些规则没有一条是「别用刀」,全都是「在这种具体情形下这样做」。

这一章要给你的,就是 AI 的那份「猫爪握法清单」。五节对应五类典型的「割手方式」:它会一脸认真地说错话(幻觉)、它会把数据里的老偏见照搬甚至放大(偏见)、你喂给它的东西和它吐出来的东西归属存疑(隐私与版权)、它能造出以假乱真的人脸和声音(深度伪造)、别人能用一段藏在网页里的文字劫持它替你干活(Prompt 注入)。

本章要回答什么

这一章的写法比其他章更严格,因为它踩在两块特别容易出错的地上:法律安全。这两个领域有一个共同特征——流传最广的说法往往错得最离谱,而且错的方式很有规律:把「上诉中」说成「已判决」,把「和解」说成「败诉」,把「特定假设下的结论」说成「永恒真理」,把「某个数据集上的误报率」说成「整体准确率」。

所以本章正文里你会反复看到三类看起来啰嗦的标注,它们不是学术做作,是防错装置:

Analogy · 体温计与「不可能造出完美体温计」

本章有一个结论最容易被误传,值得在总览页就先解释清楚,因为它关系到你读完这一章会带走什么态度。

有一篇论文(arXiv 2401.11817,新加坡国立大学,标题 Hallucination is Inevitable: An Innate Limitation of Large Language Models,2024-01-22 首版,arXiv 预印本,尚未见同行评议记录)从计算学习理论出发,论证了「幻觉不可能被完全消除」。这句话在中文互联网上经常被简化成「AI 永远不可能说准话」。

这个简化是错的,而且错得很关键。论文的结论是在一个被严格定义的形式化世界里成立的:那里「幻觉」被定义为「一个可计算的语言模型与一个可计算的真实函数之间的不一致」,推理依据是「模型学不完所有可计算函数」。换成大白话就是:如果要求一个东西能正确回答所有可能的问题,那数学上办不到。

打个比方:数学上可以证明「不存在一支能准确测量宇宙中任何物体温度的温度计」——从绝对零度到恒星核心,没有一根玻璃管能全覆盖。这个结论完全正确,但它丝毫不影响你家那支腋下体温计在 35–42 ℃ 这个区间里好用得很。「一般意义上不可能」和「在你关心的具体场景里不可靠」是两件完全不同的事。

而且原论文自己也没有走向虚无:作者同时讨论了「现有各种幻觉缓解手段的机制与效果」——说明缓解措施在作者看来仍然有价值。它也没有排除在特定受限任务上把幻觉压到零的可能。这就是本章的态度:承认边界存在,然后在边界内认真干活。

本章的五节

§ 13.1

幻觉

它不是在骗你,是在「合理地猜」。内在 vs 外在幻觉、OpenAI 的根因研究、为什么 RAG 只能缓解不能根除。

§ 13.2

偏见与公平性

Gender Shades 的 34.7% 与 0.8%、NISTIR 8280 到底测出了什么、以及「公平性不可能定理」。

§ 13.3

隐私与版权

训练数据提取攻击、五起诉讼的真实状态、EU AI Act 分阶段时间表、中国两部规章。不构成法律建议。

§ 13.4

深度伪造

为什么「检测」这条路天生吃亏、C2PA 2.4 与 SynthID 的溯源思路、以及标识义务什么时候开始管你。

§ 13.5

Prompt 注入与安全

OWASP LLM01、间接注入原论文、Anthropic 官方承认「无法根治」的原文、250 份文档的投毒实验。

学之前先记住这一点

这一章怎么读

五节相互独立,可以按需跳读。但如果你想按「跟自己关系大小」排优先级,建议这个顺序:

只读一节的话读 §13.1。因为幻觉是你每天都会遇到的,而且它的应对方法最具体、最能立刻改变你的使用习惯。读两节的话加 §13.3。因为「我输进去的东西会不会被拿去训练」「AI 画的图我能不能商用」这两个问题,几乎每个用 AI 干活的人都会撞上——而这一节能告诉你的最有用的一件事是:这个问题的答案取决于你用的是消费级产品还是 API,两者的默认策略在官方文档里是明确不同的。

如果你在做产品或者写代码,§13.5 是必读。Prompt 注入是这几年新出现的攻击面,而它跟传统的 SQL 注入有一个致命区别:SQL 注入可以靠「把数据和指令严格分开」来根治,而大模型的输入里数据和指令天生是同一种东西——都是文本。这个区别决定了它为什么这么难修。

§13.2 建议慢读,它是全章唯一有大量数字的一节,而这些数字最容易被引错。这一节真正想教的不是记住「34.7%」,而是学会问一句:这个数字测的是误报率还是漏报率、在哪个数据集上、样本构成是什么。这一节还专门澄清了一处 NIST 自己出面纠正过的误传。

☰ 主页
学海无涯 · 智能篇 · 第 13 章