Chapter · 06

第 6 章 · 训练三部曲

Training Trilogy · 数据 · 模型 · 损失

上一章讲了神经网络的骨架,但骨架不会自己学。让 AI 真正"学会",需要数据(教材)、模型(大脑)、损失(考卷分数)三样东西。这一章分五个子篇讲清楚:一个 AI 从"新手"到"会做题"的完整训练流程——以及现代大模型的三段式训练法。

本章要回答什么

训练 AI 到底在训练什么?为什么数据要分训练/验证/测试三份?梯度下降为什么能让百亿参数一步步收敛?预训练 → SFT → RLHF/DPO 三阶段各自解决什么问题?看完这五篇,你就能看懂"某某公司预训练了 XXB 参数模型"这类新闻背后到底发生了什么。

Analogy · 譬喻

训练一个 AI 就像培养一个高考状元——教材(数据)越多越全越好,大脑(模型)天赋越高越强,考试反馈(损失)越及时越准越好。反复练习、针对错题改进——这就是梯度下降;从"填鸭式"记忆到"讨老师喜欢",则是三段式训练法要走完的路。

五节各回答一个问题

先理清"训练"和"使用"是两件事

这是初学最容易混的一点,务必先分清。

训练是把模型"造出来"的过程——几万张显卡连轴转几个月,烧掉几千万美元,把一堆随机数字调成有用的参数。这件事全世界只有十几家公司干得起。使用(业内叫"推理")是你打开 ChatGPT 打字聊天的过程——参数已经固定不动了,只是拿它算一遍答案,成本是训练的几百万分之一。

打个比方:训练像编一本字典——几百个专家花几年时间,逐条推敲每个字的释义。使用像查这本字典——你翻开找一个字,一秒钟的事。字典编好了就不再改,除非哪天出新版。所以你跟 AI 聊天时,它并不会"学到"什么,这轮对话结束就忘干净了;真正的学习只发生在训练阶段。

这一章的顺序不是随便排的

五节对应训练流水线上的五个环节,严格按实际发生的先后顺序排

先有数据(§6.1),才谈得上模型该多大(§6.2);模型定了,得有办法衡量它答得好不好、并据此调整(§6.3);有了这套机制,才能开始烧钱的预训练(§6.4);预训练出来的东西还只是个"什么都懂但不听话"的半成品,最后要靠对齐把它调教成能用的助手(§6.5)。

这五节读完,你会对一件事有全新的体感:你每天随手用的那个对话框,背后是一条极其庞大、极其昂贵、每个环节都可能翻车的工业流水线。Meta 公开过一个数字——他们训练 Llama 3 时,一万六千张显卡的集群在 54 天里中断了 466 次,平均每天崩三次。这不是事故,这是常态。

本章的五节

§ 6.1

数据 · Dataset

规模 / 质量 / 多样性 / 训练验证测试三集分离。

§ 6.2

模型 · Model

参数量、架构、初始化、超参数——待训练的神经网络长啥样。

§ 6.3

损失 & 梯度下降

交叉熵/MSE + 蒙眼下山——让损失越来越小的核心算法。

§ 6.4

预训练 · Pre-training

几十 T 语料预测下一词——基座大模型是这么烧出来的。

§ 6.5

SFT · RLHF · DPO 对齐

三步走:学对话 → 学人类偏好 → 让模型"讨人喜欢"。

学之前先记住这一点

☰ 主页
Xue Hai Wu Ya · Vol.03 AI · Chapter 06