Chapter · 06

第 6 章 · 训练三部曲

Training Trilogy · 数据 · 模型 · 损失

上一章讲了神经网络的骨架,但骨架不会自己学。让 AI 真正"学会",需要数据(教材)、模型(大脑)、损失(考卷分数)三样东西。这一章分五个子篇讲清楚:一个 AI 从"新手"到"会做题"的完整训练流程——以及现代大模型的三段式训练法。

本章要回答什么

训练 AI 到底在训练什么?为什么数据要分训练/验证/测试三份?梯度下降为什么能让百亿参数一步步收敛?预训练 → SFT → RLHF/DPO 三阶段各自解决什么问题?看完这五篇,你就能看懂"某某公司预训练了 XXB 参数模型"这类新闻背后到底发生了什么。

Analogy · 譬喻

训练一个 AI 就像培养一个高考状元——教材(数据)越多越全越好,大脑(模型)天赋越高越强,考试反馈(损失)越及时越准越好。反复练习、针对错题改进——这就是梯度下降;从"填鸭式"记忆到"讨老师喜欢",则是三段式训练法要走完的路。

本章的五个子篇

§ 6.1

数据 · Dataset 篇

规模 / 质量 / 多样性 / 训练验证测试三集分离。

§ 6.2

模型 · Model 篇

参数量、架构、初始化、超参数——待训练的神经网络长啥样。

§ 6.3

损失 & 梯度下降篇

交叉熵/MSE + 蒙眼下山——让损失越来越小的核心算法。

§ 6.4

预训练 · Pre-training 篇

几十 T 语料预测下一词——基座大模型是这么烧出来的。

§ 6.5

SFT · RLHF · DPO 对齐篇

三步走:学对话 → 学人类偏好 → 让模型"讨人喜欢"。

学之前先记住这一点

☰ 主页
Xue Hai Wu Ya · Vol.03 AI · Chapter 06