Chapter · 06
第 6 章 · 训练三部曲
Training Trilogy · 数据 · 模型 · 损失
上一章讲了神经网络的骨架,但骨架不会自己学。让 AI 真正"学会",需要数据(教材)、模型(大脑)、损失(考卷分数)三样东西。这一章分五个子篇讲清楚:一个 AI 从"新手"到"会做题"的完整训练流程——以及现代大模型的三段式训练法。
本章要回答什么
训练 AI 到底在训练什么?为什么数据要分训练/验证/测试三份?梯度下降为什么能让百亿参数一步步收敛?预训练 → SFT → RLHF/DPO 三阶段各自解决什么问题?看完这五篇,你就能看懂"某某公司预训练了 XXB 参数模型"这类新闻背后到底发生了什么。
Analogy · 譬喻
训练一个 AI 就像培养一个高考状元——教材(数据)越多越全越好,大脑(模型)天赋越高越强,考试反馈(损失)越及时越准越好。反复练习、针对错题改进——这就是梯度下降;从"填鸭式"记忆到"讨老师喜欢",则是三段式训练法要走完的路。
本章的五个子篇
§ 6.1
数据 · Dataset 篇
规模 / 质量 / 多样性 / 训练验证测试三集分离。
§ 6.2
模型 · Model 篇
参数量、架构、初始化、超参数——待训练的神经网络长啥样。
§ 6.3
损失 & 梯度下降篇
交叉熵/MSE + 蒙眼下山——让损失越来越小的核心算法。
§ 6.4
预训练 · Pre-training 篇
几十 T 语料预测下一词——基座大模型是这么烧出来的。
§ 6.5
SFT · RLHF · DPO 对齐篇
三步走:学对话 → 学人类偏好 → 让模型"讨人喜欢"。
学之前先记住这一点
- 训练 = 调权重模型里几十亿到几千亿的数,一点点调到"能预测对"的状态——本质是数学优化。
- 数据质量比数量更重要垃圾进、垃圾出——同样的模型架构,好数据能训出好几倍效果。
- 三段式训练是现代标配预训练砸算力、SFT 学对话、RLHF/DPO 学讨喜欢——ChatGPT/Claude/DeepSeek 都是这条路。
- 2024 后新趋势DPO 简化 RLHF,RL 推理训练让 o1/R1 学会"一步步想"。
Xue Hai Wu Ya · Vol.03 AI · Chapter 06