§ 2.3 · Sub-chapter

深度学习 · DL 篇

Deep Learning

深度学习是机器学习里一个特定分支:用"深层神经网络"来学。它是过去 12 年 AI 领域所有突破的共同底座——从人脸识别到 ChatGPT,都在这一格。

生活场景
🏭 一条判断"这是不是猫"的流水线

想象一条工厂流水线:
· 第 1 层工人只看"图上有没有直线和拐角";
· 第 2 层工人根据前一层的判断,看"有没有眼睛的圆圈、有没有耳朵的三角";
· 第 3 层工人根据前两层的结论,判断"是不是脸";
· 最后一层工人根据"脸的样子"给出:这是猫 / 狗 / 人。

每个工人都很笨,只做一件小判断;但一层套一层,整条流水线就能干出复杂的事。这就是深度学习的"深"字。

为什么要"深"

浅层网络(1-2 层)只能学最简单的规律(比如线性关系)。多加几层,网络能逐层抽象——越靠后的层,看到的信息越"高级":

L1

底层 · 认边缘

图像 → 直线、拐角、明暗。
文字 → 单个字符或音节。

L2

中层 · 认组件

图像 → 眼睛、鼻子、轮子。
文字 → 词、短语的意思。

L3

高层 · 认整体

图像 → 猫、车、人脸。
文字 → "抱怨"还是"表扬"。

深度学习为什么忽然火了

神经网络这个概念早在 1958 年就有了,为什么等到 2012 年才爆发?三个条件同时成熟:

Analogy · 三个齿轮

大数据、算力、算法——就像三个齿轮,缺一个都转不起来。2012 年 AlexNet 一举夺魁,正是三个齿轮第一次咬合的时刻。

常见的六种网络"造型"

名字擅长典型应用
MLP · 多层感知机基础形态结构化数据分类、回归
CNN · 卷积神经网络图像人脸识别、医学影像、抖音特效
RNN / LSTM · 循环网络短序列早期语音识别、时间序列预测
Transformer · 变换器长序列 · 语言大语言模型(GPT、Claude、DeepSeek)
GAN · 生成对抗网络造假图换脸、老照片修复、艺术风格迁移
Diffusion · 扩散模型造图 / 视频Midjourney、Stable Diffusion、Sora

深度学习的两大代价

DL vs 传统 ML · 什么时候用哪个

场景更适合为什么
结构化表格数据(1000 条)传统 ML(如 XGBoost)数据少,DL 训不出来
图像 / 语音 / 文本深度学习非结构化数据 DL 独一档
要求解释性(金融风控)传统 ML决策树 / 逻辑回归可读
移动端 / 边缘部署传统 ML 或 蒸馏后的小 DL算力受限
要"极致效果"深度学习只要有数据有算力,DL 常胜
Recap · 收束

深度学习是"当代 AI 的引擎"——今天几乎所有让人惊艳的产品都靠它。但它不是万能,数据少、算力紧、需要解释性时,传统机器学习仍然是更好的选择

☰ 主页
Xue Hai Wu Ya · § 2.3 · DL