§ 2.3 · Sub-chapter
深度学习 · DL 篇
Deep Learning
深度学习是机器学习里一个特定分支:用"深层神经网络"来学。它是过去 12 年 AI 领域所有突破的共同底座——从人脸识别到 ChatGPT,都在这一格。
生活场景
🏭 一条判断"这是不是猫"的流水线
想象一条工厂流水线:
· 第 1 层工人只看"图上有没有直线和拐角";
· 第 2 层工人根据前一层的判断,看"有没有眼睛的圆圈、有没有耳朵的三角";
· 第 3 层工人根据前两层的结论,判断"是不是脸";
· 最后一层工人根据"脸的样子"给出:这是猫 / 狗 / 人。
每个工人都很笨,只做一件小判断;但一层套一层,整条流水线就能干出复杂的事。这就是深度学习的"深"字。
为什么要"深"
浅层网络(1-2 层)只能学最简单的规律(比如线性关系)。多加几层,网络能逐层抽象——越靠后的层,看到的信息越"高级":
L1
底层 · 认边缘
图像 → 直线、拐角、明暗。
文字 → 单个字符或音节。
L2
中层 · 认组件
图像 → 眼睛、鼻子、轮子。
文字 → 词、短语的意思。
L3
高层 · 认整体
图像 → 猫、车、人脸。
文字 → "抱怨"还是"表扬"。
深度学习为什么忽然火了
神经网络这个概念早在 1958 年就有了,为什么等到 2012 年才爆发?三个条件同时成熟:
- 大数据互联网积累了千亿级的图像、文本,为训练提供燃料。
- GPU 算力显卡把矩阵运算加速上百倍,让大网络能在几周内训完。
- 关键算法反向传播、ReLU、Dropout、Batch Normalization——一批小技巧组合起来让深层网络稳定收敛。
Analogy · 三个齿轮
大数据、算力、算法——就像三个齿轮,缺一个都转不起来。2012 年 AlexNet 一举夺魁,正是三个齿轮第一次咬合的时刻。
常见的六种网络"造型"
| 名字 | 擅长 | 典型应用 |
|---|---|---|
| MLP · 多层感知机 | 基础形态 | 结构化数据分类、回归 |
| CNN · 卷积神经网络 | 图像 | 人脸识别、医学影像、抖音特效 |
| RNN / LSTM · 循环网络 | 短序列 | 早期语音识别、时间序列预测 |
| Transformer · 变换器 | 长序列 · 语言 | 大语言模型(GPT、Claude、DeepSeek) |
| GAN · 生成对抗网络 | 造假图 | 换脸、老照片修复、艺术风格迁移 |
| Diffusion · 扩散模型 | 造图 / 视频 | Midjourney、Stable Diffusion、Sora |
深度学习的两大代价
- 要海量数据深层网络参数多,数据不够就"过拟合"。所以 GPT-4 训练用了 13 万亿 token。
- 要巨额算力训练一次 GPT-4 的电费据估算超过千万美元。这就是为什么只有大公司玩得起最前沿。
- 黑盒 · 难解释网络里有几百亿参数在协作,人几乎无法"翻译"某个具体决策是怎么做出来的。
- 对分布外数据敏感训练时没见过的场景,模型可能给出高度自信但完全离谱的答案。
DL vs 传统 ML · 什么时候用哪个
| 场景 | 更适合 | 为什么 |
|---|---|---|
| 结构化表格数据(1000 条) | 传统 ML(如 XGBoost) | 数据少,DL 训不出来 |
| 图像 / 语音 / 文本 | 深度学习 | 非结构化数据 DL 独一档 |
| 要求解释性(金融风控) | 传统 ML | 决策树 / 逻辑回归可读 |
| 移动端 / 边缘部署 | 传统 ML 或 蒸馏后的小 DL | 算力受限 |
| 要"极致效果" | 深度学习 | 只要有数据有算力,DL 常胜 |
Recap · 收束
深度学习是"当代 AI 的引擎"——今天几乎所有让人惊艳的产品都靠它。但它不是万能,数据少、算力紧、需要解释性时,传统机器学习仍然是更好的选择。
Xue Hai Wu Ya · § 2.3 · DL