第 5 章 · 神经网络
机器学习是"从数据里找规律",那"深度学习"就是用一层一层堆起来的"人工神经元"去找规律。ChatGPT、Sora、AlphaGo、人脸识别、语音助手——背后跑的都是神经网络。这一章拆成六个子篇,把深度学习的核心组件全部串起来。
本章要回答什么
一颗"人工神经元"到底做了什么?很多神经元堆起来为什么能学会认脸、写文章、画图?反向传播凭什么能让百亿参数自动调对?CNN、RNN、GAN、Diffusion 这四种主流架构各自擅长什么?把这六个子篇看完,深度学习 90% 的常见工具你就能识别。
你识字识物的过程,也是分层的——先看线条、再拼部首、再合成字、再判断意思。神经网络就是照抄大脑这个"分层抽象"的思路,只不过每一层的"神经元"只是一段简单的数学公式,靠数量和层数堆出复杂能力。
六节各回答一个问题
- 一颗神经元到底在算什么?——说白了就是"把几个数各乘一个权重,加起来,再看够不够门槛"。像老式收音机的旋钮,转一点点,声音就变一点点。
- 百亿个旋钮,谁来调?——反向传播:结果错了,从最后一层往前一层层追责,算出每个旋钮该往哪边转多少。跟菜太咸了往回查"哪一步盐放多了"是一个道理。
- 为什么认图片要专门的架构?——CNN 卷积网络:像拿一枚印章在照片上一格一格盖过去,专门找"这里有没有边、有没有角"。
- 为什么处理句子要另一种架构?——RNN 循环网络:像一边听一边记笔记,笔记带到下一句继续用。它的短板也正是这本笔记太小,记不住太远的事。
- 机器怎么"凭空"画出一张没见过的脸?——GAN 对抗网络:造假币的和验钞的互相较劲,假币越造越真。
- Midjourney 那种出图又是什么原理?——Diffusion 扩散模型:先学会怎么把照片一步步糊成雪花点,再把这个过程倒放。
先说清"神经"这两个字的水分
"神经网络"这个名字容易让人误会,好像里面真有什么类似脑细胞的东西。其实关系相当远。
1943 年,麦卡洛克(Warren McCulloch)和皮茨(Walter Pitts)第一次用数学描述神经元:接收几个输入信号、各自打个折扣加起来、超过某个阈值就"激发"。这个模型确实是从生物神经元借来的灵感——但也就借了这么多。真实的脑细胞有几百种类型、有复杂的化学递质、有随时间变化的连接强度,而人工神经元从头到尾只是一个乘加运算加一个开关函数。
所以更贴切的理解是:神经网络是一台由几十亿个旋钮组成的、可以自动调参的函数拟合机器。它之所以厉害,不是因为像大脑,而是因为"层数足够多、旋钮足够多、数据足够多"这三件事凑到一起后,涌现出了谁也没预料到的能力。
这一章的两条主线
六节看着杂,其实是两条线。
第一条线是"怎么学"(§5.1、§5.2)。一颗神经元怎么算、一层层怎么堆、错了怎么往回改。这两节是全章地基,也是整个深度学习的地基——后面所有花样架构,学习方式都还是这一套。
第二条线是"怎么变着花样搭"(§5.3 到 §5.6)。同样的学习机制,针对不同的数据形状要换不同的搭法:图片有"相邻像素相关"的特点,所以用卷积;句子有"前后顺序有意义"的特点,所以用循环;要生成新东西,就得设计对抗或者扩散这样的巧妙训练目标。
读的时候有个诀窍:每碰到一个新架构,先问"它假设数据有什么特点"。CNN 假设"重要的特征在局部、换个位置还是同一个东西";RNN 假设"顺序有意义、离得近的关系更紧"。想清楚这个假设,架构里那些奇怪的设计立刻就有了道理。
本章的六节
神经元
加权求和 + 激活函数——一个"人工神经元"的全部秘密。
前向 & 反向传播
数据怎么流动、错误怎么反传——神经网络学习的引擎。
CNN · 卷积网络
图像专家——从 AlexNet 到 YOLO,看图靠它。
RNN / LSTM
序列专家——2017 之前的 NLP 主力,被 Transformer 取代。
GAN · 对抗网络
假币贩子 vs 警察——两个网络较量学会造假。
Diffusion · 扩散模型
Midjourney / Sora 背后——从噪声一步步生成图像。
学之前先记住这一点
- 神经元不神秘就是"加权和 + 激活函数"两步——所有花活都是它堆出来的。
- 深度学习 = 深神经网络"深"就是层数多;"学习"就是靠数据把每一层的权重调准。
- 四种主流架构各有专长CNN 看图 · RNN 读文(老派)· GAN 造假 · Diffusion 生成——今天的多模态基本靠这套组合拳。
- Transformer 是超集下一章会讲的 Transformer,几乎"接管"了 RNN 的地盘,还渗透到 CNN 和 Diffusion 里。