§ 4.4 · Sub-chapter

自监督学习篇

Self-Supervised Learning

监督学习要"人工标答案",成本高到天花板。自监督学习的关键洞察——数据本身就藏着答案,让机器自己造问题来考自己。这就是今天所有大语言模型(GPT、Claude、DeepSeek)的训练方式。

生活场景
📖 老师让你"自己出题考自己"

你有一本小说,老师不给你出题,让你"把小说里的句子挖掉一个词,自己填回去"。
原句:"今天天气真____,我们去公园吧。"
你遮住"好"字,再问自己:"这里应该是什么?" 答:"好。"
这样练 100 万次,你不仅记住了所有词,还潜移默化理解了"什么词通常出现在什么语境"。
你不需要老师标答案——原文本身就是答案

监督 / 无监督 / 自监督 · 一张图说清

方法答案来自哪需要人标注?典型应用
监督学习人工标注必须垃圾邮件识别、医疗影像
无监督学习没有答案不需要用户聚类、降维
自监督学习数据本身不需要大语言模型预训练

自监督的三大经典任务

01

掩码预测 · Masked

把句子里一个词挖掉,让模型猜。
例:"人工智能是计算机科学的一个____。"
BERT 就是这么训的。

02

下一词预测 · Next Token

给前 N 个词,猜下一个。
例:"今天天气真" → 下一个词大概率是"好"。
GPT 系列就是这么训的。

03

对比学习 · Contrastive

给两张图,判断"是不是同一个东西"。
同一只猫的两张照片 vs 猫和狗的照片。
图片搜索、人脸识别常用。

大语言模型是怎么"自监督"出来的

GPT-4、Claude、DeepSeek 这些大模型,预训练阶段用的是下一词预测

1. 准备数据

把互联网上所有文本(网页、书籍、代码、论文)都爬下来,几万亿字。

2. 把文本切成 token

"今天天气真好" 切成 ["今天", "天气", "真", "好"] 这样的小单元。

3. 喂给模型,让它预测下一个 token

给 "今天天气真",模型输出"好"的概率分布。

4. 跟真实下一个 token 对比

如果模型预测对,奖励;预测错,惩罚。模型不断调整参数。

5. 重复几万亿次

模型在几万亿次"猜下一个词"的练习后,不仅学会了语言规律,还顺带学到了世界知识——因为文本里包含了人类的全部知识。

Analogy · 读完整个图书馆

一个人类小孩,如果从小把图书馆的书都读一遍,他不需要老师教他"什么是苹果、什么是爱情、什么是相对论"——他自己就从书里学出来了。
大语言模型就是那个"读完全部互联网"的小孩。没有老师,但它读得太多了——这就是自监督的威力。

为什么自监督是"大模型的命门"

自监督 + 微调 · 今天的标准配方

今天训练一个 AI 产品,几乎都是这两步:

第一步 · 自监督预训练

用海量无标注数据(几万亿字),让模型学"世界通用知识"——花几周、花几百万美元。

第二步 · 监督微调 / RLHF

用少量标注数据(几万条问答对),让模型学"怎么聊天、怎么礼貌、怎么安全"——花几天、花几十万美元。

第一步是"打地基",第二步是"装修"。没有第一步,第二步无从谈起。

自监督学习的局限

自监督 vs 人类学习

人类学习其实也很"自监督"——小孩不需要老师告诉他"这是桌子、这是椅子",他自己观察世界就懂了。
但人类比 AI 强的地方在于:人类有身体,能摸、能尝、能跌倒——这就是"具身智能"(Embodied AI)想补的课。今天的大模型只有"读"的能力,没有"体验"的能力。

Recap · 收束

自监督学习 = "让数据自己教自己"。它是 2018 年之后最重要的范式突破——没有它,就没有 GPT、没有 ChatGPT、没有今天的大模型时代。
下一篇我们看 ML 的三个基础概念——特征、标签、过拟合

☰ 主页
Xue Hai Wu Ya · § 4.4 · Self-Supervised Learning