深度学习 · DL
深度学习是机器学习里一个特定分支:用"深层神经网络"来学。它是过去 12 年 AI 领域所有突破的共同底座——从人脸识别到 ChatGPT,都在这一格。它和上一节的经典机器学习有一个决定性的区别:经典 ML 需要人先把原始数据加工成特征,深度学习自己把特征也一起学了。这一句话看起来只是省了一道工序,实际上它解放了图像、语音、文本这三个人类根本没法手工描述的领域。这一节讲清"深"字究竟深在哪、表示学习为什么是它的真正内核、2012 年那一天到底发生了什么、六种主流架构各自解决什么问题、以及这条路线不得不背的两笔债——算力账单和黑箱难题。
想象一条工厂流水线:
· 第 1 层工人只看"图上有没有直线和拐角";
· 第 2 层工人根据前一层的判断,看"有没有眼睛的圆圈、有没有耳朵的三角";
· 第 3 层工人根据前两层的结论,判断"是不是脸";
· 最后一层工人根据"脸的样子"给出:这是猫 / 狗 / 人。
每个工人都很笨,只做一件小判断;但一层套一层,整条流水线就能干出复杂的事。这就是深度学习的"深"字。
先把术语翻译成人话
深度学习这一节的名词密度最高,而且大半是英文缩写。它们听着玄,拆开都很朴素。先一次性摊平——换成大白话,再各配一个生活里的对应物:
| 术语 | 换成大白话 | 生活里对应什么 |
|---|---|---|
| DL(Deep Learning,深度学习——用层数很多的神经网络来学) | 把一个大判断拆成很多层小判断,一层套一层 | 工厂流水线:每个工位只干一道极小的工序,串起来就能出成品 |
| 层(Layer——网络里一排同时干活的计算单元) | 流水线上的一个工位 | 包饺子的一排人:这一排只管擀皮,下一排只管包 |
| 参数(Parameter——网络里那一大堆可以拧的旋钮) | 每个工人手上"该看多重、该按多紧"的那些设定值 | 厨房里每个环节的火候和盐量,只不过这里有几百亿个这样的钮 |
| 表示学习(Representation Learning——让机器自己决定该用什么方式描述数据) | 不是人告诉它该看哪儿,是它自己琢磨出该看哪儿 | 老厨师没人教他"看鱼眼判断新鲜",是他在菜市场逛了二十年自己摸出来的 |
| 端到端(End-to-End——原料直接进、成品直接出,中间不拆模块) | 一条龙包办,中间不交接 | 装修找一家全包,而不是自己分别找水电、木工、油漆再对接 |
| 迁移学习(Transfer Learning——把在大任务上学到的本事搬到小任务上) | 老本行的手艺换个场子照样能用 | 做过八年餐厅切菜的人去医院食堂上班,刀工不用重学 |
| 梯度消失(Vanishing Gradient——纠错信号一层层往前传的过程中衰减到几乎为零) | 意见从最后一道工位往前传,传到第一排已经听不见了 | 开会时老板的话经十级传达,到一线只剩"好像要加班" |
| ReLU(Rectified Linear Unit,修正线性单元——把负数直接截成 0 的极简函数) | 负数一律按 0 算,正数原样放过 | 门口那个"低于 1 米 2 免票"的规矩,简单到不用算 |
| Dropout(随机失活——训练时随机让一部分单元罢工) | 故意每次抽掉几个工人,逼着剩下的人都得会干 | 班组每天随机放几个人假,防止全组只依赖一个老师傅 |
| 残差连接(Residual Connection——加一条跨层的"跳线") | 给最后一道工位和第一排之间架一条直通电话 | 写字楼里那部直达顶层的电梯,不用一层层爬 |
| 知识蒸馏(Knowledge Distillation——让小模型模仿大模型的输出) | 大师傅带徒弟,徒弟不必读完所有书,只学师傅怎么判断 | 老师把厚厚一本教材浓缩成一份十页笔记给学生 |
| 量化(Quantization——把高精度参数压成低精度整数) | 把每个旋钮的刻度从"精确到小数点后六位"改成"只分十档" | 把行李从大箱子换成压缩袋,装的还是那些衣服,占的地方小多了 |
| 对抗样本(Adversarial Example——人眼看不出、却能骗过模型的微小扰动) | 在图上撒一层看不见的粉,它就认错了 | 把停车标志上贴两张不起眼的小贴纸,识别系统读成限速牌 |
这张表里最值得先记住的是表示学习那一行。深度学习真正的本事不是"层多",而是"该看哪儿不用人教"——说白了:以前是人先把原料切成模型能吃的形状,现在整颗菜扔进去它自己会处理。剩下的名词,本质上就是为了让这条很长的流水线别在中途卡死而发明出来的一堆修补件。
为什么要"深"
浅层网络(1-2 层)只能学最简单的规律(比如线性关系)。多加几层,网络能逐层抽象——越靠后的层,看到的信息越"高级":
底层 · 认边缘
图像 → 直线、拐角、明暗。
文字 → 单个字符或音节。
中层 · 认组件
图像 → 眼睛、鼻子、轮子。
文字 → 词、短语的意思。
高层 · 认整体
图像 → 猫、车、人脸。
文字 → "抱怨"还是"表扬"。
这里有个理论上的悖论值得说清。1989 年数学上已经证明了万能逼近定理:只要隐藏层足够宽,一层神经网络就能逼近任意连续函数。既然一层就够,为什么还要深?答案是"能表达"和"学得出、划得来"是三回事。一层网络要达到同等表达力,需要的神经元数量可能随问题复杂度指数级膨胀,而深层网络只需要线性地加层。这就好比表达"1024"这个数:宽网络是"1+1+1+…"写一千零二十四个 1,深网络是"2 的 10 次方"——深度带来的是复用,每一层都在复用下一层已经建好的零件。
再打一个更贴身的比方:写文章。浅层做法是把每篇文章都从笔画开始拼起来;深层做法是先有笔画,笔画组成字,字组成词,词组成句,句组成段。"词"这个中间层一旦建立,就能被无数句子复用,你不必为每个新句子重新发明汉字。深度网络的每一层,本质都在造这样一套可复用的"零件库"。
2013 年 Zeiler 和 Fergus 做了一件很直观的事:他们把训练好的卷积网络每一层的神经元"最喜欢看到什么图案"可视化出来。结果和理论惊人吻合——第一层是各个方向的边缘和色块(几乎就是生物视觉皮层的 Gabor 滤波器);第二层是纹理、拐角、同心圆;第三层出现了轮胎、文字、网格;第四层能看到狗脸、鸟腿;第五层直接是完整的物体和场景。没有人告诉网络"你这一层负责找边缘",这个分工是训练自己涌现出来的。
那些"训不动"的毛病,用一条流水线全能讲明白
上面那张技巧表里的名词,单个记很难,串成一个故事就很好记。打个比方:把一个几十层的神经网络看成一条几十道工位的流水线,那么深度学习史上那几个关键技巧,全都是在解决"这条线太长了会出什么毛病"。
| 流水线上的毛病 | 它在网络里叫什么 | 那个技巧怎么治 |
|---|---|---|
| 最后一道工位发现次品,意见往前传,传到第三道已经没人听得清了 | 梯度消失 | ReLU 让每一级传话不打折;残差连接直接架一条直通线,相当于装了部直达电梯,意见一步到顶 |
| 整条线全指着第七工位那个老师傅,他一请假就停产 | 过拟合、单点依赖 | Dropout 每天随机放几个人假,逼得每个工位都得学会兜底 |
| 上游送来的半成品尺寸忽大忽小,下游每天都得重新校一遍工装 | 内部协变量偏移 | Batch Normalization 在每道工位前加一道整形,把尺寸统一到同一量级 |
| 每个工位手上的旋钮该拧多快,全靠厂长一个个喊,喊不过来 | 学习率难调 | Adam 给每个旋钮配一个自己的调速器,各拧各的 |
| 必须严格一个接一个传,前一道没完成后一道只能干等 | RNN 无法并行 | Transformer 直接取消传递顺序,全部工位同时开工 |
为什么这个视角值得记住?因为它揭示了这个领域一个反直觉的规律:深度学习史上大多数关键突破,不是"想出了更聪明的算法",而是"把某个挡路的小石头搬开了"。ReLU 就是"负数按 0 算",残差连接就是"加一条跳线",Dropout 就是"随机罢工"——本质上就是三个中学生都能听懂的点子,却分别顶开了一道当时全行业都过不去的门。
翻译成人话:这条流水线的能力上限,从来不由最聪明的那道工位决定,而由最容易卡住的那一环决定。所以这个领域的历史,读起来更像一部"排障史"而不是"发明史"。
算力账单换算成能看懂的数:那"1750 亿参数"到底多大
技术文章里的数字有个通病:写得越大越没感觉。"1750 亿参数""13 万亿 token""3640 PetaFLOP/s-day"这几个词摆在一起,除了"很多"之外传达不了任何东西。所以这里把它们全部换算成日常尺度。
| 技术数字 | 换算成日常尺度 |
|---|---|
| GPT-3 的 1750 亿参数 | 每个参数写一张 A4 纸,摞起来大约 17 公里高——是珠峰的两倍。如果换成一本书 500 页,这叠纸够印三千五百万本 |
| 13 万亿 token 的训练数据 | 粗算约等于一千万本长篇小说。一个人每天读一本、一年不休,要读两万七千年 |
| 700 亿参数模型占 140GB 显存 | 相当于要把 140 部高清电影同时全部展开摊在桌上,而且一秒都不能收起来——这就是为什么它装不进一张消费级显卡 |
| 训练算力 每 3 到 4 个月翻一倍 | 好比房租每季度涨一倍:第一年从一千涨到一万六,第二年就是二十五万。这个速度远快于摩尔定律的两年一倍 |
| 2012 年 AlexNet 两张显卡训五六天 | 就像两个人花一周装修完一间屋子;而今天的前沿模型是上万人连轴装修三个月——同一个行业,十年间的工程量差了六个数量级 |
这些换算不是为了唬人,而是为了让下面这句话变得可感:当训练成本从"两张显卡一周"变成"上万张卡三个月",AI 研究的性质就从"聪明人的事"变成了"能拉到多少资本和电力的事"。说白了:这条曲线上升的不只是性能,还有门票价格。
反过来看,也正因为账单大到这个程度,才有了三个专门"往回省"的方向:蒸馏(Distillation——让小模型学大模型的判断)把师傅的本事压成一份薄笔记;量化(Quantization——把每个旋钮从高精度压成低精度)把 32 位浮点压到 4 位整数,显存需求掉四分之三;剪枝(Pruning——把几乎不起作用的连接直接剪掉)像给树修枝,砍掉不结果的枝条。这三招合起来,能让原本要一整柜服务器的模型跑在一台笔记本甚至一部手机上。
表示学习:深度学习真正的内核
如果只能用一个词概括深度学习的贡献,那不是"深",而是表示学习(Representation Learning)——让机器自己学会"该用什么方式描述数据"。
回到上一节的对比。经典机器学习的完整流水线是:原始数据 → 人工特征工程 → 模型 → 结果。中间那道"人工特征工程"是整个项目最费人的一环。做人脸识别,2000 年代的工程师要手工设计 Haar 特征、HOG 方向梯度直方图、SIFT 尺度不变特征;做语音识别,要设计 MFCC 梅尔频率倒谱系数。每一个都是几年心血、一篇篇论文堆出来的,而且换个任务就得重新设计。
深度学习把这条流水线缩成:原始数据 → 神经网络(特征提取 + 分类一起学)→ 结果。这叫端到端学习(End-to-End)。它的威力在语音识别上体现得最典型:传统方案要把系统拆成声学模型、发音词典、语言模型好几个独立模块,各自训练再拼起来;端到端方案直接把声波喂进去、把文字吐出来,中间所有环节由网络自己决定。拆成模块的系统里,每个模块的局部最优加起来往往不是全局最优;端到端让整条链条为同一个目标一起优化。
经典 ML: 图片像素 ──[人手写 HOG/SIFT]──▶ 特征向量 ──[SVM]──▶ "猫"
↑ 几年的研究工作
深度学习: 图片像素 ──[卷积层×N,自动学特征]──[全连接]──▶ "猫"
↑ 全部由梯度下降自己学出来
还有一个副产品比"准确率提升"更值钱:学到的表示可以搬走复用。一个在 ImageNet 上训练过的网络,它前面若干层学到的"边缘、纹理、部件"对几乎所有视觉任务都有用。于是你做一个只有 500 张 X 光片的医疗项目,可以把这个网络拿来,冻住前面的层,只重训最后几层——这叫迁移学习,它让小数据场景也能吃到大数据的红利。今天所有"预训练 + 微调"的范式,包括大语言模型,全都建立在这个思想上。
顺便说一句反例,免得把它神化:端到端不是万能的。它要求有大量数据、要求任务的输入输出都能被明确定义。自动驾驶行业为此争了很多年——纯端到端(摄像头进、方向盘出)看起来优雅,但出事时你无法定位是哪一环判断错了,也无法单独修复某个问题。所以现实中的系统大多是"分模块 + 每个模块内部用深度学习"的折中。
深度学习为什么忽然火了
神经网络这个概念早在 1958 年就有了,为什么等到 2012 年才爆发?三个条件同时成熟:
- 大数据互联网积累了千亿级的图像、文本,为训练提供燃料。
- GPU 算力显卡把矩阵运算加速上百倍,让大网络能在几周内训完。
- 关键算法反向传播、ReLU、Dropout、Batch Normalization——一批小技巧组合起来让深层网络稳定收敛。
三者各自的具体推手值得点名。数据这一环的关键人物是李飞飞:2007 年起她带团队构建 ImageNet,用众包方式给约 1400 万张图片打了两万多个类别的标签,2010 年起举办 ILSVRC 竞赛。在那之前,视觉领域的标准数据集只有几万张图,谁也训不出大网络。算力这一环的转折是 2007 年英伟达发布 CUDA,让科研人员第一次能用通用编程方式调用显卡的几千个核心——GPU 本来是为画三角形设计的,结果发现它天生就是为矩阵乘法而生,而神经网络说到底就是一堆矩阵乘法。算法这一环最容易被低估:几个看起来微不足道的改动带来了质变。
| 技巧 | 年份 | 它解决了什么"训不动"的问题 |
|---|---|---|
| 反向传播 Backprop | 1986 | 让多层网络第一次可以被高效求梯度、可训练 |
| ReLU 激活函数 | 2011 前后普及 | 取代 Sigmoid,缓解梯度消失,深层网络终于训得动 |
| Dropout | 2012 | 训练时随机"关掉"一部分神经元,强力抑制过拟合 |
| Batch Normalization | 2015 | 稳住每层输入的分布,训练速度提升数倍,可用更大学习率 |
| 残差连接 ResNet | 2015 | 加一条"跳线"让梯度直通,网络深度从几十层跃到 152 层甚至上千层 |
| Adam 优化器 | 2014 | 自动调整每个参数的学习率,大幅降低调参难度 |
| Attention / Transformer | 2014 / 2017 | 丢掉循环结构,让长序列可以并行训练,直接催生大模型时代 |
其中梯度消失值得解释,因为它是"深"字在 2011 年之前无法实现的技术原因。反向传播计算梯度时要把每一层的导数连乘起来;老式的 Sigmoid 函数导数最大只有 0.25,十层连乘就是 0.25 的十次方,约等于百万分之一——传到最前面几层时梯度已经小到近似于零,那几层等于完全不学习。ReLU 的导数在正区间恒为 1,连乘不衰减,这个几乎是"把负数截成 0"的极简改动,直接打通了深层训练。深度学习的历史里,很多突破不是靠更聪明的数学,而是靠把某个不起眼的障碍搬开。
大数据、算力、算法——就像三个齿轮,缺一个都转不起来。2012 年 AlexNet 一举夺魁,正是三个齿轮第一次咬合的时刻。
把 2012 年那件事说具体:在 ILSVRC 图像分类竞赛上,Hinton 的学生 Alex Krizhevsky 和 Ilya Sutskever 提交的 AlexNet 把 Top-5 错误率从上一年最好成绩的 25.8% 直接压到 16.4%,第二名是 26.2%。在一个每年靠零点几个百分点较劲的领域里,一次拉开近十个点,等于宣布旧方法全部作废。它用了 8 层网络、6000 万参数、ReLU、Dropout,在两张 GTX 580 显卡上训了大约五六天。
后续几年错误率一路下滑:2013 年 ZFNet 约 11.7%,2014 年 VGG/GoogLeNet 约 6.7%,2015 年 ResNet 达到 3.57%——而人类在这个数据集上的错误率约为 5%,机器在 2015 年正式越过了人眼水平。三年时间,一个领域从"勉强可用"到"超过人类",这也是为什么整个行业在那之后集体转向。
常见的六种网络"造型"
| 名字 | 擅长 | 典型应用 |
|---|---|---|
| MLP · 多层感知机 | 基础形态 | 结构化数据分类、回归 |
| CNN · 卷积神经网络 | 图像 | 人脸识别、医学影像、抖音特效 |
| RNN / LSTM · 循环网络 | 短序列 | 早期语音识别、时间序列预测 |
| Transformer · 变换器 | 长序列 · 语言 | 大语言模型(GPT、Claude、DeepSeek) |
| GAN · 生成对抗网络 | 造假图 | 换脸、老照片修复、艺术风格迁移 |
| Diffusion · 扩散模型 | 造图 / 视频 | Midjourney、Stable Diffusion、Sora |
这六种造型不是随机长出来的,每一种都是为了把某个领域的先验知识焊进网络结构里。理解这个"为什么长这样",比记住名字有用得多。
- CNN 的两个信念一是局部性——判断一个像素属于什么,主要看它周围一小片,不必看整张图;二是平移不变性——猫在左上角还是右下角都是猫,所以同一套"找猫耳朵"的权重可以在整张图上滑动复用(这叫参数共享)。这两个信念让 CNN 的参数量比同等规模的全连接网络小几个数量级。源头是 1998 年 LeCun 的 LeNet-5,当年就被用在美国的银行支票金额识别上。
- RNN / LSTM 的信念序列有时间顺序和记忆:理解"他"指谁,得记住前面提过谁。RNN 靠一个循环传递的隐藏状态来携带记忆,但原始 RNN 记不住几十步以外的事(还是梯度消失)。1997 年 Hochreiter 和 Schmidhuber 提出的 LSTM 加了输入门、遗忘门、输出门三个闸门,专门管"什么该记、什么该忘",把有效记忆拉长到几百步。它统治了 2014—2017 年的机器翻译和语音识别,但有个死穴:必须一个词一个词按顺序算,无法并行,所以训不大。
- Transformer 的信念2017 年 Google 的论文《Attention Is All You Need》做了一件很激进的事——把循环结构整个删掉,只留注意力机制。注意力让序列中每个词直接和所有其他词计算关联度,"任意两个位置的距离都是 1 步",长依赖问题消失了;更关键的是整句话可以一次性并行计算,训练速度和可扩展性彻底解放。这就是大模型时代的技术起点,第 4 章会专门拆它。
- GAN 的信念2014 年 Goodfellow 提出:造假的最好办法是让两个网络互相对抗。生成器负责造假图,判别器负责鉴别真伪,两者在博弈中共同进步——像造假币的和验钞机在军备竞赛。它让 2018 年前后的"AI 换脸""这个人不存在"成为可能。缺点是训练极不稳定,容易崩溃(模式崩塌:生成器发现只画同一张脸就能骗过判别器,于是不再产生多样性)。
- Diffusion 的信念与 GAN 的对抗思路相反,扩散模型走的是"学会去噪":训练时不断往清晰图片上加噪声,直到变成纯雪花,然后让网络学会反向的每一步去噪。生成时从一团随机噪声出发,一步步"雕"出图像。它训练稳定、多样性好、可控性强,2022 年之后基本取代 GAN 成为图像生成的主流——Stable Diffusion、Midjourney、Sora 都属于这一支。
- 图神经网络 GNN还有一支常被忽略但很重要的造型。它的信念是:很多数据天生是网状而非网格或序列——社交关系、分子结构、路网、推荐系统里的用户商品二部图。GNN 让每个节点不断聚合邻居的信息来更新自己的表示。DeepMind 用它做出的谷歌地图到达时间预估、以及药物分子性质预测,都是有实际收益的落地案例。
值得注意的是近几年的一个趋势:Transformer 正在吞并其他造型的地盘。2020 年 Vision Transformer(ViT)证明了把图片切成小块当"词"来处理,在足够数据量下能打败 CNN;语音、时间序列、蛋白质结构预测也纷纷换上 Transformer。架构在收敛——这意味着未来的竞争重心会从"设计什么网络"转向"用什么数据、花多少算力"。
深度学习的代价:两笔越来越贵的账
- 要海量数据深层网络参数多,数据不够就"过拟合"。所以 GPT-4 训练用了 13 万亿 token。
- 要巨额算力训练一次 GPT-4 的电费据估算超过千万美元。这就是为什么只有大公司玩得起最前沿。
- 黑盒 · 难解释网络里有几百亿参数在协作,人几乎无法"翻译"某个具体决策是怎么做出来的。
- 对分布外数据敏感训练时没见过的场景,模型可能给出高度自信但完全离谱的答案。
算力账单的膨胀速度需要具体数字才有冲击力。2012 年 AlexNet 用两张消费级显卡训了不到一周;2020 年 GPT-3 有 1750 亿参数、训练算力约 3640 PetaFLOP/s-day,估算成本数百万美元;到 GPT-4 一代,公开估算的训练成本已在千万到上亿美元区间,需要上万张高端加速卡连跑数月。有分析指出,前沿模型的训练算力在 2012—2018 年间大约每 3 到 4 个月翻一倍,远快于摩尔定律的两年一倍。
这条曲线的后果是政治性的,不只是技术性的:深度学习把 AI 研究从"聪明人 + 一台工作站"变成了"资本 + 电网 + 供应链"。学术界因此被挤出了最前沿——很多顶尖研究者转向工业实验室,只因为学校买不起卡。同时它带来了实实在在的环境成本:训练大模型的碳排放已经成为一个被正式研究的课题,也是"小模型、蒸馏、量化"这些方向如今如此热门的原因——把一个大模型的能力"教"给一个小模型(知识蒸馏)、把 32 位浮点参数压成 8 位甚至 4 位整数(量化),能让模型在手机上跑起来,成本降几个数量级。
还有一笔容易被忽视的账:数据的边际收益在递减,而数据本身正在枯竭。有研究者估算,高质量的公开文本语料可能在不远的将来被消耗完。这就是为什么"合成数据""数据配比""数据质量"成了 2024 年之后最热的研究方向之一——当算力和参数都能靠钱解决时,数据反而成了最硬的约束。
黑箱问题与可解释性:最难的一笔债
一个上百亿参数的网络给出了"这张 CT 提示恶性"的结论,你问它为什么,它给不出理由。这不是工程没做好,而是结构性的:它的"知识"分散在几百亿个浮点数的相互作用里,没有任何一个位置写着"我判断依据是第三根肋骨下方的阴影"。这就是黑箱问题。
为什么这件事非解决不可?因为有些领域法律上要求解释。欧盟的 GDPR 赋予个人对自动化决策要求解释的权利;欧盟《人工智能法案》把医疗、招聘、信贷、司法等场景列为高风险,要求透明度和可追溯性。一个不能解释自己的模型,在这些领域就是不能用,无论它多准。
学界发展出了几类"事后打探"的工具,各有局限:
| 方法 | 做法 | 能回答什么 | 局限 |
|---|---|---|---|
| 显著性图 / Grad-CAM | 算出输入哪些像素对结果影响最大,画成热力图 | "它在看图的哪一块" | 只说"看哪里",不说"为什么那里重要" |
| LIME | 在单个样本附近扰动输入,用简单模型局部拟合 | "这一次判断靠哪几个特征" | 只在局部成立,换个样本结论可能变 |
| SHAP | 用博弈论的 Shapley 值分配每个特征的贡献 | 特征贡献度,有数学一致性 | 计算量大,高维时近似误差明显 |
| 特征可视化 | 反向构造"最能激活某神经元"的图像 | "这个神经元在找什么" | 常出现人类无法命名的抽象图案 |
| 机制可解释性 | 直接逆向工程网络内部的计算回路 | 试图给出真正的因果机制 | 刚起步,只在极小模型上有成功案例 |
一个必须记住的区分:可解释(Interpretable)和事后解释(Explainable)不是一回事。决策树、线性回归是天生可解释的——模型本身就是解释。深度网络只能事后解释,而事后解释可能是一个听起来合理但并非模型真实依据的故事。研究者 Cynthia Rudin 为此写过一篇著名的批评文章,主张在高风险场景里就该直接用天生可解释的模型,而不是给黑箱套一层解释的外衣自欺欺人。
还有个和黑箱同源的麻痹症状:它错的时候依然很自信。对抗样本是最刺眼的证据——2013 年起研究者发现,给一张熊猫照片加上人眼完全看不出的微小扰动,模型会以 99% 的置信度判定它是长臂猿。在物理世界也成立:在停车标志上贴几张小贴纸,就能让识别系统读成限速牌。这说明网络学到的"猫的特征"和人类理解的"猫"并不是同一套东西——它只是在训练数据的分布上恰好一致罢了。这也解释了为什么它对分布外数据如此脆弱:一个只见过晴天路况的自动驾驶模型,遇到暴雪不是"不确定",而是"自信地做错"。
DL vs 传统 ML · 什么时候用哪个
| 场景 | 更适合 | 为什么 |
|---|---|---|
| 结构化表格数据(1000 条) | 传统 ML(如 XGBoost) | 数据少,DL 训不出来 |
| 图像 / 语音 / 文本 | 深度学习 | 非结构化数据 DL 独一档 |
| 要求解释性(金融风控) | 传统 ML | 决策树 / 逻辑回归可读 |
| 移动端 / 边缘部署 | 传统 ML 或 蒸馏后的小 DL | 算力受限 |
| 要"极致效果" | 深度学习 | 只要有数据有算力,DL 常胜 |
这张表可以压缩成一条判断线:看数据是"人能描述特征的"还是"人描述不了的"。信贷申请表上的年龄、收入、负债率,本身就是人类总结好的特征,树模型直接用效果极好,DL 反而没有优势——多项对比研究都显示在中小规模表格数据上梯度提升树仍然稳定优于神经网络。反过来,一张 CT 片有几百万个像素,没有任何人能写出"什么像素组合代表病变",这时候只有 DL。
但今天更常见的答案是两者混用。一个真实的推荐系统往往长这样:用深度模型(甚至直接用预训练大模型)把商品图片、标题文本、用户评论压成向量表示(embedding),再把这些向量和"用户年龄、历史点击率、当日时段"这些人工特征拼在一起,最后交给一个 GBDT 或者浅层网络做最终排序。让 DL 干它擅长的"把非结构化数据变成向量",让树模型干它擅长的"在结构化特征上做精确决策"。
最后给一条务实的工作顺序,能省下大量时间:永远先用简单模型做基线。先跑逻辑回归或 XGBoost,拿到一个分数,然后再上深度模型。如果深度模型只比基线高一两个点,而训练成本高一百倍、可解释性归零、上线维护复杂十倍,那这笔交易就不该做。深度学习是一把很重的锤子,重锤有重锤的用法,但别用它敲图钉。
深度学习是"当代 AI 的引擎"——今天几乎所有让人惊艳的产品都靠它。但它不是万能,数据少、算力紧、需要解释性时,传统机器学习仍然是更好的选择。
七条要点收束:(1) "深"的价值不是表达力(一层理论上就够),而是复用——每层复用下层建好的零件,把指数级的宽度需求换成线性的深度需求;(2) 它真正的内核是表示学习,把人工特征工程这道最费人的工序自动化了,并顺带带来了迁移学习;(3) 爆发靠三个齿轮咬合——ImageNet 的数据、CUDA 的算力、ReLU/Dropout/残差这批算法;(4) 2012 年 AlexNet 把错误率从 25.8% 打到 16.4%,2015 年 ResNet 的 3.57% 越过人眼水平;(5) 六种架构各自把领域先验焊进结构里,而 Transformer 正在统一战场;(6) 代价是算力账单每几个月翻倍,把 AI 从"聪明人的事"变成了"资本的事";(7) 黑箱与对抗样本说明它学到的东西和人类的理解并不是同一套,这是它在高风险领域最大的障碍。先跑简单基线,再决定要不要抬出这把重锤。