§ 1.4 · Section

四种能力篇 · 感知 / 理解 / 决策 / 生成

Perceive · Understand · Decide · Generate

抛开定义之争,AI 能做的事说到底就四件:感知世界、理解意思、做出决策、生成内容。任何一个 AI 产品,都能拆解到这四种能力里。前面三节讲的是"AI 有多强"这个纵向的层级;这一节换成横向的切法——不问它属于哪一级,只问它由哪几块能力拼成。这把尺子的实用价值极高:以后无论遇到什么新产品、新论文、新概念,你都能先把它拆成这四块,再判断它到底新在哪。

生活场景
🍜 你在餐馆点一碗面,脑子干了四件事

你走进一家面馆坐下。这几分钟里,你的大脑不声不响地走完了一整套流程:

· 感知——眼睛扫过墙上的菜单,把那些墨点认成"牛肉面 18 元""酸辣粉 12 元";耳朵听见邻桌"这家辣得很过瘾"。
· 理解——你明白"过瘾"在这儿是夸奖不是抱怨,也明白菜单上"微辣/中辣/特辣"是同一个维度的三档。
· 决策——你怕辣但想尝,加上时间只够吃二十分钟,于是选了中辣的牛肉面。
· 生成——你抬头对老板说出一句他能听懂的话:"老板,一碗牛肉面,中辣,不要香菜。"

先把术语翻译成人话

这一节会冒出一批英文缩写和技术名词。它们听着玄,落到实处都很朴素。先把本节核心名词一次性摊在一张表里,翻译成人话再各配一个生活里的对应物:

术语换成大白话生活里对应什么
感知(Perceive——把外界信号变成机器能读的数字)睁开眼、竖起耳朵,先把东西"收进来"医院挂号窗口先量体温、抽血、拍片,把你身上的情况变成一张张单子
理解(Understand——从收进来的东西里抽出"意思")看懂这些单子在说什么毛病医生拿着化验单读出"这是细菌感染,不是病毒"
决策(Decide——在多个选项里挑一个)在几种方案里定一个医生决定是开药、住院还是转到别的科室
生成(Generate——造出原本不存在的内容)把想法变成一份别人能拿走用的东西医生写出那张处方单,你拿着它去排队取药
CNN(Convolutional Neural Network,卷积神经网络——拿一个小窗口在图上到处滑,专门找局部图案的网络)用放大镜一块一块扫过整张图,先找边角,再拼成整体超市理货员挨个货架扫一遍,先看单品,再拼出"这一排是饮料区"
ViT(Vision Transformer,视觉变换器——把图片切成小方块,当成"词"来读的网络)把一张图剪成拼图块,然后像读句子一样读这些块把一整面墙的笔记撕成便签,一张张读完再拼出全文意思
ASR(Automatic Speech Recognition,自动语音识别——把声波变成文字的程序)把说出来的话变成打出来的字会议室里那个专职记录的人,边听边把话敲成笔记
OCR(Optical Character Recognition,光学字符识别——把图片里的字认出来)照片里的字被抠出来变成可复制的文本把纸质发票拍一张照,金额自动填进银行报销单
CLIP(Contrastive Language-Image Pre-training——让图片和文字落到同一套坐标里的模型)让"狗的照片"和"狗"这两个字在数学上挨得很近图书馆把中文书和英文书按同一套主题编号上架,找起来不分语言
Agent(智能体——能自己观察、思考、动手、再观察的程序)不再是你问一句它答一句,而是给个目标它自己跑完全程你只说"帮我把这个包裹寄到广州",快递小哥自己称重、贴单、装车、扫描
误差累积(Error Accumulation——每一步的小错在链条上乘起来)每步都差一点,走完二十步就面目全非传话游戏:一句话经过二十个人转述,最后那句已经不是原话

看完这张表,其实就是一句话:AI 的四种能力,跟你去一趟医院的流程一模一样——先化验(感知)、再读单(理解)、再定方案(决策)、最后开处方(生成)。后面每个技术名词第一次正式出场时,都会再跟一句大白话解释,你不用现在记住。

为什么是这四种:一条信息流水线

这四种能力不是随便列的清单,它们是一条有严格顺序的信息通路,对应着"从物理世界进来、在内部加工、再回到物理世界"的完整闭环。

物理世界  ──感知──▶  数字表示  ──理解──▶  内部语义
                                              │
                                            决策(选一个动作)
                                              │
物理世界  ◀──生成──  输出内容  ◀────────────┘
                        │
                        └──▶ 环境变化 ──▶ 重新感知(闭环)

这条流水线可以套到任何智能系统上。人类是这样:眼睛看到红灯(感知)→ 明白这是禁止通行(理解)→ 决定踩刹车(决策)→ 脚上肌肉发力(生成)。自动驾驶也是这样,只是每一环换成了摄像头、感知网络、规划器、控制信号。四种能力的顺序不能颠倒,且每一环的上限会封死后面所有环的上限——感知错了,理解一定错;理解错了,决策必然错。这是所有 AI 系统调试的第一原则:出问题先往上游查,而不是在下游打补丁

还有一点很关键:四种能力的技术难度顺序,和人类的直觉正好相反。人类觉得"看见"最简单、"创作"最难,但对机器来说,"生成一篇通顺文章"在 2022 年就基本解决了,而"在陌生厨房里认出咖啡机并拿起来"至今没解决。这就是上一节提到的莫拉维克悖论在这条流水线上的体现。

用一趟地铁通勤,把四种能力再走一遍

上面那条流水线画成图很清楚,但图是抽象的。打个比方,我们拿一件每天都在发生的事重走一遍——早上你从家出发去办公室这一趟里你的大脑把四种能力各跑了几十遍,只是你完全没察觉

通勤片段你脑子里在干的活儿对应哪种能力机器做同一件事难在哪
走到电梯口,看一眼数字把屏幕上那几个墨块认成"7 楼,正在下行"感知换个字体、换个反光角度,识别率就掉——这是分布偏移
发现电梯停在 18 楼不动推断"可能有人在搬家堵着门"理解这一步要的是常识和因果,模型最弱的一环
转身走楼梯算了一下"等三分钟"和"走六层"哪个划算决策要在没有明确评分函数的情况下比较两个选项
在群里发一句"我可能迟到五分钟"把心里的判断变成同事能看懂的一句话生成这一步机器反而最强,2022 年后基本解决
地铁站,人流突然变密重新排队、重新估时间感知 → 理解 → 决策(闭环重跑)机器难在"知道什么时候该推翻上一轮结论"

这张表想让你看到的不是流程,而是难度分布整趟通勤里,唯一一件机器已经干得比你好的事,是最后那句"我可能迟到五分钟"——写句通顺的话它是行家。而"看一眼就知道电梯为什么不动"这种你完全没花力气的判断,机器至今做不好。简单说:链条上人觉得最轻松的那几环,恰恰是机器最贵的那几环。

还有一层更要紧的:这一趟里闭环跑了不止一遍。你不是感知一次就完事,而是每隔几秒重新看一眼、重新判断一次。本质上就是"边走边纠"。而今天大部分 AI 系统只跑一遍就交答案,没有"再看一眼"这个动作——这也是为什么给系统加上"观察—行动"的循环(也就是后面要讲的 Agent)会带来质变。

四种能力的成本账:哪一环最贵,哪一环最容易被外包

做产品时你会立刻发现一件事:这四块能力的价格差得离谱。理解这份账单,比理解技术原理更能帮你判断一家公司在干什么。

能力自己做要花什么能不能直接买现成的典型的"外包"方式
感知最贵的是标注:一张医学影像要专家逐个勾病灶轮廓;一段路测视频要人逐帧框出行人和车通用场景能买(人脸、车牌、通用 OCR),特殊场景买不到调用云厂商的识别 API
理解贵在领域知识:通用语义有现成大模型,但"这份合同的哪条不利于我方"需要行业积累通用部分白菜价,行业部分买不到用大模型打底 + 自己补一层规则和词表
决策贵在试错环境:要么有仿真器,要么有海量历史交互日志,两者都不便宜基本买不到,因为它和你的业务目标绑死没法外包——这也是它最常成为护城河的原因
生成贵在推理算力:文本已经便宜到可以随便送,视频一段十秒仍然要真金白银几乎全部可以买,且价格每年掉一个台阶按 token、按张、按秒计费调 API

这张账单能推出一条相当硬的判断规则:凡是能按次买到的能力,都不会是护城河好比开一家餐厅——调料和餐具人人都能去菜市场买同一家,那你的本事只能落在别人买不走的地方:那口锅的火候、那份配方、以及回头客名单。放到 AI 产品上,"别人买不走的"通常只有两样:你独有的数据,和你独有的决策目标。

顺带解释一个常见困惑:为什么这两年一大批"AI 应用"看起来很像、又都活得很紧张?说白了就是它们把重心押在了生成这一环,而生成恰好是四环里唯一能整块买到的。你买得到,你的竞争对手也买得到,而且下个月还更便宜。

动手练:把身边三个 AI 拆成四块

这一节的尺子只有真正用过才算学会。给你三个例子,先自己在心里拆一遍,再看下面的答案——相当于做完作业再对答案,比直接看讲解记得牢得多。

产品感知(收什么)理解(抽出什么意思)决策(在什么里挑)生成(吐出什么)
手机相册的"搜索"你相册里几万张照片的像素每张图被压成一串向量,"海边""猫""生日蛋糕"各占一个方向按和你输入词的距离排序,挑前几十张几乎不生成,只是把缩略图排进货架式网格
扫码点单机菜单页面上你的点击、以及摄像头扫的码把点击翻译成"这桌要三份微辣"判断库存、判断出餐顺序(这一环其实是厨房在做)打印出后厨那张小票
输入法的联想你已经敲进去的那几个字结合你的历史习惯判断你要打的是"重庆"还是"重新"从候选词表里排前六个把候选词渲染到候选栏上

拆完你会注意到一个反直觉的结论:这三个产品里,被大众当成"AI 味最重"的那一环——生成——其实全都最轻。相册搜索几乎不生成,点单机只打小票,输入法只是把词摆出来。真正决定体验好坏的是理解和决策:相册能不能读懂"去年夏天在海边那张",输入法能不能猜准你的习惯。

所以这把尺子最实用的地方,是帮你把注意力从最显眼的那一环挪到最要命的那一环。下次你觉得某个 AI 产品"不好用",别急着说它模型不行,先拆一遍:是它没看清(感知)、没听懂(理解)、选错了(决策),还是话说得不好(生成)?四个位置对应四套完全不同的修法,认错位置等于白修。

能力一 · 感知(Perceive)

把物理世界翻译成机器能读的数字。没有感知,AI 就是"闭眼睛的天才"。

感知类型典型技术身边的应用
视觉CNN、ViT人脸识别 / 车牌识别 / 医疗影像
听觉ASR、Whisper语音输入 / 语音助手 / 会议纪要
触觉 · 传感IMU、力矩机器人、可穿戴设备
OCR · 文字文字识别发票扫描 / 拍照翻译 / 扫码识文

技术原理 · 视觉这一支的三十年演进。1998 年 Yann LeCun 的 LeNet-5 用卷积网络识别手写邮政编码,确立了 CNN 的基本结构:用小窗口在图像上滑动提取局部特征,逐层组合成越来越抽象的模式——底层几个像素的边缘和角点,中层眼睛和轮子这样的部件,高层完整的猫和汽车。真正的爆发点是 2012 年的 AlexNet:它在 ImageNet 竞赛上把错误率从 26% 一举压到 15.3%,比第二名领先十个百分点,用的是 GPU 训练加上 ReLU 激活和 Dropout。这一年通常被当作深度学习时代的起点。2015 年 ResNet 用"残差连接"让网络能堆到一百层以上,在 ImageNet 上的错误率降到约 3.6%,低于人类标注员的约 5%。2020 年 Vision Transformer(ViT)证明了另一条路:把图像切成小方块当成"单词"序列,直接用处理语言的 Transformer 架构来做,在数据量足够大时效果更好。

听觉这一支的关键转折。语音识别在深度学习之前用的是"隐马尔可夫模型加高斯混合"的组合,需要音素词典和大量语言学知识。深度学习之后走向端到端:直接从声波映射到文字,中间不再显式建模音素。2022 年 OpenAI 的 Whisper 是个标志性成果——它用了 68 万小时的多语言音频训练,能在嘈杂环境、口音、专业术语下保持稳定,还能顺手做翻译。这里的启示是:感知能力的突破往往不是靠更精巧的模型,而是靠数据规模跨过某个量级

多模态:感知的当前前沿。2021 年 OpenAI 的 CLIP 做了一件影响深远的事:用四亿组"图片 + 文字描述"训练,让图像和文字被映射到同一个向量空间里。于是"一张狗的照片"和"a photo of a dog"这句话在数学上位置相近。这个看似简单的对齐带来了两个巨大后果:第一,实现了零样本分类——你不需要为"识别牛油果酱"专门训练,只要把这个词写出来就能拿去比对;第二,它成了后来所有文生图模型(Stable Diffusion 等)的语义桥梁,因为你终于有办法把"文字要求"翻译成"图像空间里的方向"。

局限。感知层的问题至今相当扎实:对抗样本——在图片上加一层人眼完全看不出的噪声,就能让分类器把熊猫认成长臂猿,置信度还高达 99%;分布偏移——训练时没见过的天气、角度、光照会让性能断崖下跌;标注偏见——数据集里的人群比例失衡会直接变成系统性错误率差异;没有"不确定"这个输出——模型被迫在给定类别里选一个,即使正确答案根本不在选项里。这些都不是小 bug,而是当前范式的结构性弱点。

能力二 · 理解(Understand)

从内容里抽出"意思"。感知给出"这是什么",理解回答"它在说什么、意味着什么"。

技术原理 · 从词典到向量的观念革命。早期自然语言处理把词当成互不相关的符号:把"猫"编成第 1024 号,"狗"编成第 3391 号,两者之间没有任何数学关系。2013 年 Google 的 Word2Vec 改变了这一切——它用"根据上下文预测词"的简单任务训练,让每个词变成一个几百维的向量,结果向量之间竟然浮现出语义结构,最著名的例子是那个几乎像魔术的等式:向量("国王") − 向量("男人") + 向量("女人") ≈ 向量("女王")。这说明意义可以被表示为空间中的方向,而不只是符号。

真正的分水岭是 2017 年的 Transformer。那篇论文的标题《Attention Is All You Need》本身就是宣言。它的核心机制"自注意力"解决了一个老问题:怎么让模型知道一个词该跟句子里哪些词联系起来。在"动物没有过马路因为太累了"这句里,"它"指动物;把"累"换成"宽","它"就指马路。自注意力让每个词都去计算自己与句中所有其他词的关联权重,从而动态决定"该看谁"。这一机制的另一个决定性优势是可以完全并行计算——之前的 RNN 必须一个词一个词按顺序处理,而 Transformer 一次吞下整句,这才让训练规模扩大几个数量级成为可能。今天几乎所有大模型(GPT、Claude、Gemini、Llama、DeepSeek)都建立在这个架构上。

上下文与意图:理解的两个高阶层次。字面意思之上还有两层。上下文是指同一句话在不同语境下含义不同——"这个方案很有意思"在会议上可能是赞赏,也可能是委婉的否定;处理它依赖足够长的上下文窗口和对话历史。意图更进一步,要推断说话人真正想达成什么——用户说"这个太贵了",真实意图可能是"有便宜的替代品吗"而不是在陈述价格。语言学上这叫"言语行为",处理它需要某种程度的心理理论(Theory of Mind),即对他人心理状态的建模能力。这也是当前模型表现最参差的地方。

局限。理解层最著名的批评来自哲学家 John Searle 1980 年提出的中文房间思想实验:一个完全不懂中文的人待在房间里,按一本极详尽的规则手册把递进来的中文条子转换成合理的中文回复,房外的人会以为他懂中文——但他其实什么都不懂。Searle 用它论证符号操作不等于理解。这个论证六十年来被反复辩驳(有人反驳说"房间整体"是懂的,就像单个神经元也不懂中文但大脑懂),但它精确指出了一个仍未解决的问题:我们至今没有一个可操作的方法,去区分"真的理解"和"表现得像理解"。工程上的具体表现就是幻觉——模型能极其流畅地讲一个完全不存在的历史事件,而它自己毫无察觉。

能力三 · 决策(Decide)

在多种可能里选一个"更好的"。只要有取舍,就有决策空间。

A

推荐系统

抖音下一个视频、淘宝首页、Netflix 排片——从千百个候选里挑最合你意的。

B

规划路径

高德地图算最快路线;快递骑手 App 排配送顺序;自动驾驶实时决定加速刹车。

C

博弈决策

下棋、打游戏、金融交易——在对手也会反应的场景里,决策难度指数级上升。

D

风控 / 审核

银行判断是否放贷;平台判断内容是否违规——都是"是 / 否 / 待审"的决策。

技术原理 · 三条并存的技术路线。决策能力不是一种技术,而是三类差别很大的方法各管一片:

路线怎么工作适用条件代表
搜索把所有可能的动作序列展开成一棵树,用启发函数剪掉没希望的分支,找最优路径规则明确、状态可枚举、有明确评价函数A* 算法(导航)、Minimax + Alpha-Beta 剪枝(国际象棋)、蒙特卡洛树搜索(围棋)
规划给定初始状态、目标状态和可用动作,反向或正向推出一串动作。可分层:先定大步骤再细化状态可描述、动作后果可预测机器人任务规划、物流排程、大模型 Agent 的任务分解
强化学习不给正确答案,只给奖励信号。智能体在环境里试错,逐步学会"什么状态下做什么动作能拿到最多长期回报"能大量试错(真实或仿真)、奖励可定义AlphaGo / AlphaZero、游戏 AI、机器人控制、RLHF 训练大模型

强化学习值得单独说,因为它是四种能力里唯一天生带"闭环"的技术。它的核心概念只有五个:状态(现在什么情况)、动作(能做什么)、奖励(做完得多少分)、策略(在什么状态选什么动作)、价值(当前状态的长期期望回报)。它最难的一点叫探索与利用的权衡:一直吃已知最好的那家餐馆(利用),你永远发现不了更好的;每天都乱试(探索),你会吃很多难吃的饭。所有强化学习算法本质上都在这条张力上找平衡点。它第二难的一点叫信用分配:下了两百手棋最后输了,到底哪一手是败因?这就是为什么棋类和游戏成了强化学习的主战场——它们能反复重来、奖励清晰、还能自我对弈无限产生数据。

局限。决策层的问题最贴近真实世界的麻烦。奖励设定即价值取向:推荐系统若以"停留时长"为奖励,最优解就是推送让人上瘾和愤怒的内容——这不是算法失灵,是奖励定得太窄,也正是 § 1.3 里"规格博弈"的现实版本。长时序衰减:一个需要二十步的任务,若每步成功率 95%,整体成功率只剩约 36%,这就是当前 Agent 做长任务不稳的数学原因。探索成本:自动驾驶不能靠撞车来学习,医疗不能靠试错来学习,这类高风险领域强化学习难以直接应用。缺乏可解释性:模型拒绝了一笔贷款,很难给出符合监管要求的理由说明。

能力四 · 生成(Generate)

造出以前不存在的内容。这是 2022 年之后 AI 最出圈的一支——从"识别"跨到"创作"。

模态代表产品典型用途
文字ChatGPT、Claude、DeepSeek写作、代码、翻译、总结
图像Midjourney、Stable Diffusion、可灵海报、插画、产品渲染
视频Sora、Runway、可灵、即梦短视频、创意广告
音频 / 音乐Suno、Udio、ElevenLabs整首歌、配音、有声书
3D · 建模Meshy、Tripo游戏资产、AR 素材
代码Cursor、Copilot、TRAE写代码、写测试、修 bug

技术原理 · 文本生成靠"自回归"。大语言模型做的事只有一件:给定前面所有词,预测下一个词的概率分布,采样一个,然后把它接到后面,再预测下一个。就这么循环。它的所有能力都是这个机制的副产品。有两个参数决定了输出的性格:temperature 控制随机性——接近 0 时总选概率最高的词,输出稳定但呆板;调高则更多样但可能跑偏。top-p 则限定只从累积概率前若干的候选里采样,避免选到那些荒谬的低概率词。

自回归生成的循环(伪代码)

tokens = 编码(用户输入)
while 未遇到结束符 and 长度 < 上限:
    logits = 模型(tokens)             # 对词表里每个词打分
    probs  = softmax(logits / temperature)
    next_t = 按 top_p 截断后采样(probs)
    tokens.append(next_t)             # 关键:自己的输出成为下一轮输入
输出 = 解码(tokens)

# 注意:这里没有任何"事实核查"环节
# 模型只在优化"这个词接在后面像不像人写的"
# ——这就是幻觉的机制性根源

图像生成靠"扩散"。思路极其巧妙,分两个方向。前向过程:拿一张真实图片,一步步往上加高斯噪声,加几百步后变成纯噪声——这一步不需要学,是确定的数学操作。反向过程:训练一个网络去预测"这一步加的噪声是什么",学会之后就能反过来从纯噪声一步步去噪,还原出一张图。生成时给它一段文字,用 CLIP 那类文本编码器把文字变成向量,在每一步去噪时引导方向,最终得到符合描述的图像。2022 年 Stable Diffusion 的关键改进是把这套过程从像素空间搬到了压缩后的潜空间,算力需求下降一个数量级,这才让消费级显卡也能跑,直接引爆了整个开源生态。

视频生成难在哪。视频不是"很多张图片",它多了一个必须处理好的维度:时间一致性。同一个人在第 3 秒和第 8 秒必须是同一张脸、同一件衣服;物体被遮挡后再出现必须还在;水要往下流不能往上流。早期视频生成的典型失败就是人物脸部在帧间"漂移"、四肢数量偶尔变化。当前主流做法是用"时空注意力"同时在空间和时间两个方向建模,并把物理合理性作为隐式学习目标。这也是为什么视频生成模型常被视为世界模型的早期形态——要生成合理的视频,它必须在某种程度上"知道"物体会掉落、会碰撞、会遮挡。

局限。生成层的问题最被公众熟知也最具争议:幻觉——机制性的,因为目标函数里没有"真"这个维度,只有"像";版权与训练数据来源——正在全球范围内引发诉讼和立法;可控性——你想改图里一个细节,往往整张图都变了;细节崩坏——手指数量、文字渲染、镜面反射至今是老大难;同质化——模型倾向输出训练数据里的平均审美,导致大量作品"一眼 AI";深度伪造——同一套技术做配音也能做诈骗电话。

Analogy · 四条腿的动物

把 AI 想象成"四条腿的动物":
· 感知 = 眼睛耳朵;
· 理解 = 大脑皮层;
· 决策 = 前额叶;
· 生成 = 双手嘴巴。
缺一条腿,AI 就跑不起来。今天最强的 AI 产品几乎都是四腿齐全。
这个类比还能再挖一层:四条腿的长度必须匹配,否则会原地打转。一个感知极强但决策很弱的系统(比如只会识别不会行动的监控),只能当传感器;一个生成极强但理解很弱的系统(比如能写漂亮却错误的报告),会变成高效的错误制造机。实际产品失败最常见的原因不是某条腿太短,而是四条腿严重不匹配。

四种能力如何组合成智能体(Agent)

把四种能力串成闭环并加上工具和记忆,就得到了 2024 年之后最热的形态——AI Agent。它和一个聊天机器人的本质区别在于:聊天机器人的循环是"你问它答",而 Agent 的循环是"它自己观察、思考、行动、再观察",人只在开头给目标、在关键处确认。

Agent 组件对应能力它在做什么
Observation 观察感知读取屏幕截图、文件内容、API 返回、命令行输出、传感器数据
Reasoning 推理理解解析当前状态、判断离目标还差什么、识别刚才那一步是成功还是失败
Planning 规划决策把大目标拆成子任务,决定下一步调用哪个工具、传什么参数,出错时改换策略
Action 行动生成产出具体的工具调用、代码、命令、文本回复——生成能力在这里从"写文章"变成了"写指令"
Memory 记忆贯穿四者短期靠上下文窗口,长期靠向量数据库检索。它让"经验"能跨越单次任务累积
Tools 工具四种能力的外接扩展搜索引擎补知识、计算器补算术、代码执行器补精确性、数据库补事实。本质是承认模型自己不擅长什么,就外接一个专门的弱 AI 来补

这里有个很值得玩味的循环:Agent 的做法,实际上是让一个"最宽的弱 AI"去调度一堆"最窄的弱 AI"。大模型负责理解意图和编排流程,具体的精确计算、检索、执行交给传统程序和专用模型。这正好把 § 1.1 讲的"专用性优势"和大模型的"通用性优势"缝在了一起,也解释了为什么"工具调用"被认为是过去两年最重要的工程突破之一——它不需要模型变得更强,只需要承认它的边界并在边界外接上别的东西。

但闭环也带来了新的脆弱性。四种能力串联时,误差会起来而不是加起来:感知误读了一个数字,理解就会建立在错误前提上,决策会据此规划,生成会执行一串错误动作,而下一轮观察又会把结果当成新的事实。这叫误差累积,也是当前所有 Agent 系统必须设计"人类确认点"和"回滚机制"的原因。前面算过的那个数字值得再看一遍:单步 95% 的成功率,二十步之后只剩三成多。提升 Agent 可靠性的关键从来不是让模型更聪明,而是缩短链条、增加校验、让每一步可撤销

如何用这四种能力"透视"一个 AI 产品

拿三个熟悉的产品跑一遍这套尺子,你会立刻看出它们的差别在哪:

产品感知理解决策生成
抖音推荐你的停留、点赞、划走时长把行为翻译成兴趣向量核心所在:从百万候选里排序只是拼一个信息流页面,几乎不生成
自动驾驶核心所在:摄像头 + 雷达 + 激光雷达融合识别车道、行人意图、他车轨迹路径规划 + 实时避障方向、油门、刹车的控制信号
编程助手读代码库、报错信息、你的光标位置核心所在:理解意图和代码结构决定改哪个文件、调哪个工具写出代码补丁并执行测试

看出规律了吗?同样是"AI 产品",它们的重心完全落在不同环上。推荐系统几乎不需要生成能力,自动驾驶的胜负八成在感知,编程助手拼的是理解深度。所以下次听到"我们也用了大模型"这句话时,正确的追问是:"你的大模型用在哪一环?那一环原来是靠什么做的?换成大模型之后好了多少?"——这三个问题能过滤掉绝大部分噪音。

Recap · 收束

感知 / 理解 / 决策 / 生成,是 AI 能力的"四原色"——不管产品叫什么名字,本质都是这四原色的调配。学会这把尺子,你以后看 AI 就有了坐标系。
把这一节的要点串一遍:四种能力是一条有严格顺序的流水线,上游封死下游的上限,所以排错要往上游查。感知从 1998 年 LeNet 到 2012 年 AlexNet 到 2020 年 ViT,靠 CLIP 走向多模态,弱点是对抗样本和分布偏移;理解从 2013 年 Word2Vec 的向量语义到 2017 年 Transformer 的自注意力,高阶难点在上下文和意图,未解的哲学难题是中文房间;决策分搜索、规划、强化学习三条路线,核心张力是探索与利用,现实风险是奖励定得太窄;生成靠自回归做文本、靠扩散做图像、靠时空注意力做视频,幻觉是机制性的而非 bug。四者串成闭环加上记忆与工具,就是 Agent,但串联会让误差相乘——所以可靠性来自缩短链条而非拔高单点。最后记住那两个追问:这个产品的核心在哪一环?出错的代价由谁承担?

☰ 主页
Xue Hai Wu Ya · § 1.4 · Four Abilities