§ 14.4 · Section

批判性思维

语气自信和内容正确,在机制上毫无关系

「要有批判性思维」是一句正确但没用的话。这一节不打算重复它,而是给一套可以照着做的动作:三步验证法——定性、定源、定责。每一步做什么、说什么话、看什么信号,全部写成具体的动作。这一节接上 § 13.1 的幻觉机制:模型输出假话时的语气和输出真话时一模一样,因为它的机制里压根没有「我不确定」这个环节的位置。说白了:你用了几十年的那个判断信号——「他说得那么肯定,应该没错」——在这里彻底失效了。所以本节的核心不是教你怀疑,是教你把「该怀疑到什么程度」变成一个可以计算的东西:先判断这句话属于哪一类(有些类别压根不需要验证),再决定验到什么程度,最后确认出错时谁承担后果。打个比方:安检不是对每个人都开箱检查,是先分类——什么东西必须过 X 光、什么东西看一眼就能放行。

生活场景
🏥 挂号窗口前的两句话

你带家里老人去医院看病。挂号窗口排队时,前面一位大姐很热情地跟你搭话,聊了十分钟。她说了两句话:

第一句:「三楼那个消化科的王大夫特别好,你们挂他的号。」

第二句:「这个药吃了会伤肝,别听医生的,我表姐吃了半年肝就坏了。」

这两句话是同一个人、同一种语气、同样的热情说出来的。但你对它们的处理方式应该完全不同。

第一句你可以听。因为它的性质是「一个人的推荐」,而且验证成本极低(上楼看一眼评价、问一下护士),最坏后果也很轻(挂了个号不合适,换一个)。

第二句你必须拦住。不是因为她在骗人——她可能真心觉得在帮你。而是因为这句话的性质完全不同:它是一个关于用药的判断,涉及不可逆后果,而且它要你推翻一个有专业责任的人的意见。

注意这里的关键:你区分这两句话,用的不是「她可不可信」,用的是「这两句话分别是什么性质、错了会怎样」。

这就是三步验证法的全部思路。面对 AI 的输出,「它可不可信」是个没法回答的问题(有时可信有时不可信,而且你没法从语气上分辨)。能回答的问题是:这句话属于哪一类、这一类该验到什么程度、错了谁承担。

先把地基说清楚:为什么它的自信是没有信息量的

这一段不新增知识,只是把 § 13.1 讲过的原理接到本节的动作上。因为不理解这一点,后面所有验证动作你都会觉得太麻烦。

人类社会里,语气和把握程度是相关的。这个相关性是长期社交演化出来的:一个人不确定时会加「大概」「我记得好像」「你最好再问一下」;确定时才会斩钉截铁。所以「他说得很肯定」在人际交流中是一个真实有效的信号——不是绝对可靠,但确实携带信息。

而在语言模型这里,这个相关性被切断了。原因 § 13.1 讲得很清楚:

所以本节要你放弃一个习惯:不要再用「它说得多有把握」来判断内容。那个信号在这里是空的。

但要注意别走到另一个极端:「它的自信没有信息量」不等于「它说的都不可信」。大多数时候它是对的——这正是问题所在。如果它十次里错九次,你早就不用它了;正是因为它十次里对九次,那第十次才有杀伤力。打个比方:一个红绿灯十次里有九次正常,比一个坏掉的红绿灯危险得多——坏掉的那个你会绕开走,偶尔失灵的那个你会照常闯过去。

第一步 · 定性:先判断这句话属于哪一类

这是三步里最重要的一步,也是最容易被跳过的一步。因为它决定了后面要不要验、验到什么程度。

如果对所有输出一律验证,成本高到你根本不会执行——任何需要「时时保持警惕」的方案都会失败,因为人的警惕是有限资源。可执行的方案必须是分级的。

先按一个维度切:这句话能不能被外部资料判真假?

类别典型例子要不要验为什么
① 硬事实具体数字、日期、编号、条款、人名、机构名、引语原文、法律状态、版本号、价格必须验,无例外这一类是幻觉的高发区,而且错了后果直接。§ 13.1 的外在幻觉全部落在这一格
② 因果与机制「A 导致 B」「这样设计是因为 C」要验,但验的方式不同不是查一个数字对不对,是看推理链有没有断。方法见下面第二步
③ 结构与分类「这件事可以分成三个方面」「这两个概念的区别是……」大体可以采信,但要自己过一遍这一类它做得很好,因为是从大量材料里归纳出来的常见框架。但要问一句:这个分类漏了什么
④ 语言加工改写、润色、翻译、摘要、格式转换基本不用验事实,但要验忠实度§ 13.1 那两个词在这儿正好用上:这一类不看 factuality(是否符合事实),看 faithfulness(是否忠于你给的原文)
⑤ 创意与发散起名、列点子、找不同角度、举例子不用验,只用挑这一类没有对错,只有合不合用。其实就是菜市场挑菜——不用鉴定真伪,挑自己要的就行
⑥ 价值判断「该不该」「哪个更好」「值不值得」不是「要不要验」的问题,是「压根不该让它给结论」这一类涉及取舍与责任,属于 § 14.5 讲的不可外包范围。可以让它列理由,不能让它下结论

这张表最实用的价值在于:它告诉你不需要对所有输出都紧张。你每天用它做的大部分事情落在第 ④ ⑤ 类,那些完全不必费神验证。真正需要动作的是第 ①、② 类,以及第 ⑥ 类需要的是「拿回决定权」而不是「验证」。

而实践中最常见的失误,正是把第 ① 类当成第 ④ 类处理——你在做一件语言加工的活(写报告),但它在过程中顺手给了你一个具体数字,你没意识到这句话的性质变了,于是那个数字就这么进了成品。

相当于你在超市推着车随便逛,随手拿了几样东西;但其中一样是药,而药这一样是不能随手拿的。问题不在你逛得不认真,在于你没注意到手里那样东西换了类别。

Analogy · 安检口的分级:为什么不是每个人都开箱

这一节的整个思路,用机场安检来讲最直接,因为它是一套已经运行了几十年、经过实践打磨的分级验证系统。

安检不是「对所有人一律彻查」。如果那样做,队会排到马路上,而且检查会因为疲劳变得敷衍。它的做法是分级:所有行李过 X 光机(低成本的普查)、机器报警的开箱(中成本的复查)、有明确风险信号的人单独带走(高成本的详查)。

这套系统聪明的地方在于三点,正好对应三步验证法:

第一,它先分类,再定检查强度。液体、充电宝、刀具是被单独列出来的类别,不是靠安检员临场判断。这就是「定性」——把「要不要仔细看」这个决定,提前变成一条按类别执行的规则,而不是每次现场靠警觉。

第二,它认可「验证是有成本的」,所以把成本花在后果严重的地方。一瓶水被拦下不是因为水危险,是因为「无法在低成本下确认这是水」,而这一类东西错放的后果很严重。相当于本节的第一步表格:硬事实必须验,创意发散不必验,因为两者错了的后果差着量级。

第三,也是最关键的:安检员的职责是「按流程执行」,而不是「凭感觉判断这个人像不像坏人」。因为凭感觉判断会失效——坏人不会长得像坏人,正如假话不会说得像假话。这正是本节反复强调的那件事:你不能靠「它说得自不自信」来判断,只能靠「这句话属于哪一类、这一类的流程是什么」。

所以「批判性思维」这个词其实容易误导人——它听起来像是要你时刻绷着、对一切都怀疑。但那种状态既累又不可持续,而且效果不好。可持续的做法是把警惕变成流程:不是每一刻都紧张,而是在特定类别上无条件执行特定动作。

第二步 · 定源:三种具体的验证动作,按成本从低到高

定性之后,落到「怎么验」。这一步要给的是三个具体动作,而不是「去核实一下」这种空话。三个动作成本递增,按需选用。

动作一(十秒):让它自己标出哪些地方需要核实。

【自标风险清单】

针对你刚才那段回答,做三件事,不要重复原答案:

1. 列出其中所有「可以被外部资料判真假」的句子,
   逐条标注:数字 / 日期 / 编号 / 人名 / 机构 /
   引语 / 法律状态 / 版本号。
2. 对每一条标一个把握程度:
   「有明确依据」/「凭常见说法」/「不确定」。
3. 明确回答:这段回答里,
   哪一条如果错了对我影响最大?

如果某条你其实不确定,请直接写「不确定」,
不要给我一个看起来确定的说法。

这个动作有效,但必须知道它的局限,否则会造成虚假的安心。它的局限是:让它自评置信度,不构成独立验证。因为按 § 13.1 讲的机制,「我有几分把握」这个信息并不是它内部真实存在、只是没说出来的东西。说白了:你问一个记性不好的人「你这句话有多确定」,他的回答同样是凭感觉给的。

那它为什么还值得做?因为它有一个很实在的作用——把「需要核实的清单」列出来了。这份清单是你的工作清单,而列清单这件事它做得很好(属于第一步表里的第 ③ 类「结构与分类」)。其实就是:它不能替你验,但能告诉你有哪几处要验,这已经省了你一大半功夫。

动作二(两分钟):换问法问第二遍,看它会不会自相矛盾。

具体做法有三种换法,效果不同:

换法怎么问能查出什么局限
换措辞同一个问题,用完全不同的说法重问一遍(新开一个对话)能查出不稳定的编造:两次给的编号 / 日期不一样,说明至少有一次是编的两次一致不代表对——同样的统计倾向会给出同样的编造
反向问把它的结论反过来问:「有没有证据支持相反的结论」能查出它是不是在顺着你。如果它两个方向都能给出「有力证据」,说明那些证据都不硬要显式授权它说「反方站不住」,否则它会硬凑(§ 14.1 的反例模板已讲过这一点)
问细节就它给的某一条追问三层:「这个数字出自哪份文件的第几部分」「那份文件的发布机构和日期」「原文那句话怎么写的」这是最有效的一种。编造的东西经不住追细节——相当于问一个编故事的人「那家餐馆在哪条路、几点关门、老板姓什么」它可能继续编出细节。所以追问的作用是提高你的警觉,最终还是要去查

真正去第一手核实:动作三,以及四条信源顺序

动作三(几分钟到几小时):去原始来源看。这是唯一真正的验证——前两个动作严格说都只是筛选,真正的确认只能靠这一下。

而「去原始来源」这件事也有讲究,§ 14.2 给的三条硬纪律在这里再明确一次,并补上一条判断信源的顺序:

第三步 · 定责:错了谁承担,决定你该验到什么程度

这是三步里最容易被忽略、但最能校准力度的一步。前两步告诉你「怎么验」,这一步告诉你「验多深才算够」。

判断标准只有一句:验证的力度应当匹配「错了之后由谁承担、承担多少」。

错了谁承担典型场景该验到什么程度
只有你自己,且损失很小好奇查个知识、给自己起个昵称、找个周末去哪玩不用验。错了顶多白跑一趟——为这个花时间核实是不划算的
你自己,但损失不小照它说的买东西、按它给的方法处理自己的电脑、根据它的说法安排行程验硬事实(价格、型号、时间),动作二够用
你的职业信誉交给客户的方案、发出去的报告、提交的代码硬事实逐条去原始来源(动作三)。这一档不允许省,因为署名的是你(§ 14.2 已讲透)
别人会照它行动给同事的建议、给家人的用药或健康信息、给学生的知识动作三 + 明确告知对方不确定的部分。其实就是转述前加一句「这是我看到的说法,你自己再确认一下」
后果不可逆医疗、法律、财务、安全、涉及他人身体或财产的操作不是「验证够不够」的问题——这一档需要的是有专业责任的人参与,而不是更仔细的验证。详见 § 14.5

最后一行是这一步真正想说的话,值得单独讲清楚:有一类事情,无论你验证得多认真都不够。

因为这类事情缺的不是信息,是责任。医生给你开药,除了给出判断之外,还提供了一样 AI 无法提供的东西——他为这个判断负责,他有执业资格,出了事有追责路径,而且他能看到你这个具体的人。

打个比方:你在装修论坛上把某个电路问题研究了三天,读了几十篇帖子,比很多电工都懂原理。但涉及入户主线改造时,你还是要请有资质的电工——不是因为你懂得不够,是因为「谁为这个结果负责」这件事不能由知识量决定。

第 13 章的 § 13.3 也是这么处理的:那一节写了大量法律内容,但反复声明「本文不构成法律建议」,并给出三句提醒——法律有辖区、案件状态随时变化、地区法院裁定不等于终局判决它讲清了争议焦点在哪,但明确说不能作为任何具体行为的合法性依据。这就是「定责」这一步在写作上的体现。

三步之外的一件事:警惕「它顺着你说」

三步验证法处理的是「它说错了」。但还有一类问题不属于说错,而属于说了你想听的,这一类三步法查不出来,得单独防。

现象是这样的:你的问法泄露了立场,它顺着你的立场给出理由。而你收到的东西看起来是「独立的支持」,实际上是你自己观点的回声。

这件事最危险的地方在于:它让你觉得自己得到了验证,而其实什么都没发生。相当于你在一个只有自己的房间里说话,听到回声,以为有人同意你。

几种典型的「泄露立场」的问法,以及改法:

泄露立场的问法它大概会怎么答改法
「我觉得 A 方案更好,你觉得呢」肯定 A,并给出三条理由「A 与 B 各自最强的三条理由是什么,最后不要选边」
「这个说法是不是有问题」找出问题(因为你暗示了有问题)「这个说法哪里站得住、哪里站不住,两边都要说」
「帮我找支持 X 的证据」给你一堆支持 X 的说法,可能包括编造的「关于 X,支持与反对的证据分别有哪些?如果某一侧证据很弱,请直接说很弱
「我这样理解对吗」「非常准确」「我这段里最站不住的是哪一句」(§ 14.1 的坑五)
「这个数据可靠吗」倾向于给一个确认不要问它——去查来源。让它给自己的输出做担保是无效动作

这张表里最后一行值得单独强调,因为它是一个很常见的无效动作:问它「你确定吗」「这个可靠吗」,得到的确认没有任何证明力。理由和本节开头那段一样——它的「确定」和它的内容正确性之间没有机制上的关联,所以让它自我担保等于零信息。

还有一个更根本的提醒:这类问题不是「模型的毛病」,是提问方式的必然结果。§ 10 章讲过,语义几乎相同的两句提示词效果可以差很远。说白了:你问出去的话里带着答案的形状,收回来的东西自然是那个形状。相当于你去买衣服说「我觉得这件挺显瘦的吧」,导购几乎一定会说「特别显瘦」。

把三步串成一个可执行的检查动作

三步讲完了,现在压缩成一个能在几十秒内跑完的动作序列。这是本节最想让你带走的东西。

【三步验证 · 快速版】

第 1 步 定性(五秒)
问自己:这段里有没有「能被外部资料判真假」的句子?
 · 没有(纯改写 / 纯创意)→ 到此结束,不用验
 · 有 → 把那几句圈出来,进第 2 步
 · 如果是「该不该 / 值不值得」这类 → 不是验证问题,
   而是不该让它下结论(转 § 14.5)

第 2 步 定源(十秒到几分钟,按需升级)
 · 让它列出需要核实的清单(十秒,只当工作清单用)
 · 追细节:出自哪份文件、哪个机构、哪一天、原文怎么写
 · 去第一手来源看,保留限定词,记下访问日期
 · 查不到 → 写「未取得」,不要用差不多的出处替上

第 3 步 定责(五秒)
问自己:这句话错了,谁承担、承担多少?
 · 只有我、损失小 → 上面做到哪步就到哪步
 · 我的信誉 / 别人会照它行动 → 硬事实必须到第一手
 · 后果不可逆(医疗/法律/财务/安全)→ 停。
   这一档需要的是有专业责任的人,不是更仔细的验证。

这个序列的设计有一个刻意的地方:第 1 步就把大部分情况放行了。因为你日常用它做的事,绝大多数落在「纯改写、纯创意、找思路」这些不需要验证的类别里。一套只在需要时才启动的检查,才是你真的会执行的检查。

而第 3 步放在最后,是因为它决定「要不要把第 2 步再往上升一级」。顺序反过来也可以,实践中很多人是先感觉到「这事挺重要」,然后才开始认真核。本质上就是:先看这道菜是给自己吃还是招待客人,再决定要不要挑最好的那块肉。

一个反过来的提醒:别把批判性变成不用

这一节讲了很多要小心的地方,所以结尾必须把天平摆正——否则读完这一节的效果会是「算了我不用了」,那就完全走反了。

第一,验证成本是真实的,但它比重做成本低得多。核一个数字花两分钟;用了一个错数字被人当众指出来,损失是这两分钟的几百倍。相当于出门前看一眼有没有带钥匙——花三秒,省下的是被锁在门外的两小时。

第二,「不用」不是安全选项,它有自己的代价。别人两小时干完的活你花两天,这个损失是持续发生的、而且不会有人提醒你。章总览页说过一句:神化的人不检查,贬低的人不用,两种误判的代价是一样的。

第三,本节的方法都是低成本的。整套三步验证在大部分情况下只需要五秒(第 1 步定性就放行了)。真正需要动作的是那少数几句硬事实。而这少数几句,恰好也是最值得花时间的。

第四,也是最要紧的一条:验证能力本身是一种可以增长的能力。你核实的次数越多,就越知道哪些地方容易出错、哪些说法一看就该怀疑。打个比方:一个逛惯了菜市场的人一眼能看出哪筐菜是今早的,这不是天赋,是买过几百次的结果。而这种能力恰恰是 AI 时代最保值的东西——工具会一代代换,判断力是你自己的。

最后借用第 13 章那句已经用过、但在这里同样成立的话:洗手消灭不了所有细菌,但这从来不是不洗手的理由。

五种最常见的错法,以及它们的识别信号

三步验证法是流程。这一段给的是模式识别——如果你熟悉这五种典型错法,很多问题不用走完流程就能当场看出来。

这五种全部来自第 12、13 章核实工作中反复撞到的真实模式,每一种都配一个「一看到就该警觉」的信号词。

错法长什么样警觉信号怎么当场拆
① 把「上诉中」说成「已判决」拿一个还没终局的裁定当成定论引用出现「已裁定」「法院认定」但没写案号和当前状态追问:辖区、案号、当前状态、状态核实日期——四项缺一就不能当结论用。§ 13.3 的 Thomson Reuters v. Ross 就是标准例子:地区法院有部分简易判决,但案子在第三巡回上诉中,不构成有约束力先例
② 把「和解」说成「败诉」某公司和解结案,被转述为「输了官司」「败诉」「认了」这类词却没有判决书和解的三个后果要一起说:法院未就实体争议下判断、通常不确立先例、不构成任何一方的责任承认(§ 13.3 的 Bartz v. Anthropic)
③ 把「特定条件下的结论」说成「永恒真理」「有论文证明幻觉不可消除,所以 AI 永远不可能准确」出现「证明了」「永远」「根本不可能」,而不提前提条件追问:这个结论成立于什么前提?前提之外还成立吗?§ 13.1 的五条限定就是范本。可复用的拆法:「不存在能测宇宙中任何温度的温度计」完全正确,但丝毫不影响腋下体温计在 35–42 ℃ 好用
④ 把「某数据集上的误报率」说成「整体准确率」把一个特定任务、特定数据集上的数字扩大成普适结论一个百分数没绑定「哪个模型 + 哪个测试集 + 哪一天」三问:测的是误报还是漏报?哪个数据集?哪个任务?§ 13.2 记的正是 NIST 自己出面纠正过的一处误引——「性别分类」与「人脸识别」是两个任务,混引即错
⑤ 删掉限定词原文写 up to 34.7%(最高达),转述成「错误率 34.7%」数字前后特别干净,没有「最多」「初步」「预期」「理论峰值」去原文看那个数字前面还有没有词。§ 13.2 的 34.7% 与 0.8% 原文都带 up to;§ 12.1 的 NVIDIA 规格表自带「All values are up to and subject to change」,AMD 的对比数字带 expectedpeak theoretical——删掉这些词就是数字滥用

这五种错法有一个共同的结构,值得单独点出来,因为看懂它你就能识别第六、第七种:全部都是「把一个有范围的结论,搬出它的范围去用」。

说白了:一个说法在它自己的那块地里完全正确,被搬到隔壁地里就错了。而搬运这个动作,通常是靠删掉那些标明边界的词完成的——「在某数据集上」「地区法院」「预期」「最高」「初步」。相当于把药盒上的「儿童每次半片」剪掉「儿童」两个字,剩下的话每个字都是原来的,但意思完全变了。

所以本节最简洁的一条实操建议是:看到任何强结论,先找它的限定词在哪。找不到限定词的强结论,八成是被人剪过的。

怎么把这套东西教给别人(尤其是家里的长辈)

这一节的方法你自己会用是一回事,家里人会用是另一回事。而后者往往更要紧——因为最容易被错误信息伤到的,通常不是你。

教给别人时不要教流程,要教一句话。三步验证法对你有用是因为你读了这一整节;对一个不打算深究的人来说,一整套流程等于没有。

实践中比较有效的做法是给一句好记的话,加一个具体动作。下面三组是可以直接用的:

还有一件事在跟别人解释时特别管用,值得单独说:不要用「它会犯错」这种说法,要用「它错的方式和人不一样」。

因为「会犯错」这句话没有信息量——谁都会犯错。真正需要传达的是那个差异:人不确定时会露出迟疑,它不会;人不知道时会说不知道,它会给你一个格式完美的答案。

打个比方:你问路,一个真的不认识路的本地人会说「这我不太清楚,你问问前面那个报刊亭」。而它会给你一个非常具体的路线——街道名、拐几个弯、走多少米——而那条路可能不存在。本质上就是:它没有「不知道」这个档位,所以你不能靠「它有没有露出不确定」来判断。

最后一条提醒,是给你自己的:教别人时不要把它说得很可怕。如果你把结论讲成「这东西不可信,别用」,实际效果通常是两个极端之一——对方要么完全不用(错失真实的便利),要么在你不在场时照旧用而且不设防(因为你的警告太笼统,落不到具体动作上)。有效的教法永远是「在这种情况下这样做」,而不是「这东西危险」——这正是第 13 章那个菜刀类比的意思:厨房里没有一条规则是「别用刀」,全都是「在这种情形下这样握」。

Recap · 这一节的收束

地基是一句机制事实:语气自信和内容正确,在机制上毫无关系。人际交流里「他说得很肯定」是个真实有效的信号,因为人不确定时会加「大概」;而模型的生成流程里压根没有一个管「置信度」的环节(§ 8.2 的自回归机制 + § 13.1 引 OpenAI arXiv 2509.04664 的「奖励猜、不奖励承认不确定」)。它输出假话时的语气和真话一模一样。但别走到另一极端:它十次里对九次——正因为如此,第十次才有杀伤力,相当于偶尔失灵的红绿灯比彻底坏掉的更危险。

第一步 · 定性:先判断这句话属于哪一类。六类分别是——① 硬事实(数字、日期、编号、条款、人名、引语、法律状态、版本号、价格)必须验,无例外;② 因果与机制要验,但验的是推理链有没有断;③ 结构与分类大体可采信,但要问「漏了什么」;④ 语言加工不看 factuality 看 faithfulness(是否忠于你给的原文);⑤ 创意发散不用验只用挑;⑥ 价值判断压根不该让它下结论(转 § 14.5)。最常见的失误是把第 ① 类当第 ④ 类处理——你在做语言加工的活,它顺手给了个数字,你没注意到手里那样东西换了类别。

第二步 · 定源:三个动作,成本递增。动作一(十秒)让它列出需要核实的清单——但要知道让它自评置信度不构成独立验证,这份清单只当工作清单用;动作二(两分钟)三种换问法:换措辞(能查出不稳定的编造,但两次一致不代表对)、反向问(查它是否在顺着你)、问细节(最有效,编造经不住追细节);动作三是唯一真正的验证——去第一手,并守四条:第一手优于转述(转述会丢限定词,删掉 up to / preliminary / expected 意思就变了)、分清信源身份能回答什么(平台清单答「在我这有什么」,厂商文档答「规格与价格」)、官方也会自相矛盾要并列不挑一个、查不到就写「未取得」

第三步 · 定责:验证力度匹配「错了谁承担、承担多少」。五档:只有自己且损失小(不用验)→ 自己但损失不小(动作二够用)→ 职业信誉(硬事实逐条到第一手,因为署名的是你)→ 别人会照它行动(动作三 + 明确告知不确定的部分)→ 后果不可逆不是「验证够不够」的问题,这一档缺的不是信息是责任)。医生除了判断还提供一样 AI 给不了的东西:他为判断负责、有执业资格、有追责路径、能看到你这个具体的人。

三步之外单独要防的一类:它顺着你说。这类问题三步法查不出来。它让你觉得得到了验证,其实只是听到了自己的回声。五个改法:「我觉得 A 更好你觉得呢」→「A 与 B 各自最强三条理由,不要选边」;「这说法是不是有问题」→「哪里站得住哪里站不住」;「帮我找支持 X 的证据」→「两侧证据分别有哪些,弱的一侧请直接说弱」;「我这样理解对吗」→「我这段里最站不住的是哪一句」;「这个数据可靠吗」→ 不要问它,去查来源——让它给自己的输出做担保是零信息动作。

可执行的快速版:定性(五秒,多数情况在这一步就放行)→ 定源(十秒到几分钟,按需升级)→ 定责(五秒,决定要不要把第 2 步再升一级)。设计上刻意让第 1 步放行大部分情况,因为一套只在需要时才启动的检查,才是你真的会执行的检查。「批判性思维」这个词容易误导人——它听起来要你时刻绷着,但那不可持续;可持续的做法是把警惕变成流程,像安检那样:不靠安检员凭感觉看谁像坏人,靠按类别执行固定动作。

最后把天平摆正:验证成本真实,但比重做成本低得多;「不用」不是安全选项,它有自己的持续代价;整套方法在大部分情况下只需五秒;而验证能力本身是可以增长的、也是 AI 时代最保值的东西——工具会一代代换,判断力是你自己的。洗手消灭不了所有细菌,但这从来不是不洗手的理由。

下一节是全篇的收束,也是本章的价值落点:哪些决定永远不该外包给 AI。它不给禁忌清单,只给四条判断标准——因为清单会过期,标准能让你自己判断新情况。

☰ 主页
学海无涯 · 智能篇 · § 14.4