自监督学习篇
监督学习要"人工标答案",成本高到天花板。自监督学习的关键洞察——数据本身就藏着答案,让机器自己造问题来考自己。这就是今天所有大语言模型(GPT、Claude、DeepSeek)的训练方式。
你有一本小说,老师不给你出题,让你"把小说里的句子挖掉一个词,自己填回去"。
原句:"今天天气真____,我们去公园吧。"
你遮住"好"字,再问自己:"这里应该是什么?" 答:"好。"
这样练 100 万次,你不仅记住了所有词,还潜移默化理解了"什么词通常出现在什么语境"。
你不需要老师标答案——原文本身就是答案。
监督 / 无监督 / 自监督 · 一张图说清
| 方法 | 答案来自哪 | 需要人标注? | 典型应用 |
|---|---|---|---|
| 监督学习 | 人工标注 | 必须 | 垃圾邮件识别、医疗影像 |
| 无监督学习 | 没有答案 | 不需要 | 用户聚类、降维 |
| 自监督学习 | 数据本身 | 不需要 | 大语言模型预训练 |
自监督的三大经典任务
掩码预测 · Masked
把句子里一个词挖掉,让模型猜。
例:"人工智能是计算机科学的一个____。"
BERT 就是这么训的。
下一词预测 · Next Token
给前 N 个词,猜下一个。
例:"今天天气真" → 下一个词大概率是"好"。
GPT 系列就是这么训的。
对比学习 · Contrastive
给两张图,判断"是不是同一个东西"。
同一只猫的两张照片 vs 猫和狗的照片。
图片搜索、人脸识别常用。
大语言模型是怎么"自监督"出来的
GPT-4、Claude、DeepSeek 这些大模型,预训练阶段用的是下一词预测:
1. 准备数据
把互联网上所有文本(网页、书籍、代码、论文)都爬下来,几万亿字。
2. 把文本切成 token
"今天天气真好" 切成 ["今天", "天气", "真", "好"] 这样的小单元。
3. 喂给模型,让它预测下一个 token
给 "今天天气真",模型输出"好"的概率分布。
4. 跟真实下一个 token 对比
如果模型预测对,奖励;预测错,惩罚。模型不断调整参数。
5. 重复几万亿次
模型在几万亿次"猜下一个词"的练习后,不仅学会了语言规律,还顺带学到了世界知识——因为文本里包含了人类的全部知识。
一个人类小孩,如果从小把图书馆的书都读一遍,他不需要老师教他"什么是苹果、什么是爱情、什么是相对论"——他自己就从书里学出来了。
大语言模型就是那个"读完全部互联网"的小孩。没有老师,但它读得太多了——这就是自监督的威力。
为什么自监督是"大模型的命门"
- 不需要人工标注互联网文本无穷无尽,直接拿过来用——训练数据的天花板被打开了。
- 语言即知识人类几乎所有知识都用语言承载——学会"接下一个词",等价于学会了大量隐含的世界规律。
- 可以无限扩展只要算力够,就能用更大的模型、更多的数据——这就是 GPT-3 → GPT-4 → GPT-5 的演进路径。
自监督 + 微调 · 今天的标准配方
今天训练一个 AI 产品,几乎都是这两步:
第一步 · 自监督预训练
用海量无标注数据(几万亿字),让模型学"世界通用知识"——花几周、花几百万美元。
第二步 · 监督微调 / RLHF
用少量标注数据(几万条问答对),让模型学"怎么聊天、怎么礼貌、怎么安全"——花几天、花几十万美元。
第一步是"打地基",第二步是"装修"。没有第一步,第二步无从谈起。
自监督学习的局限
- 它只学"统计规律"模型学到的是"苹果后面通常跟'好吃'",但它没吃过苹果,不知道苹果到底啥味道。
- 数据决定天花板训练数据里没有的知识,模型不会知道;训练数据里的偏见,模型会原封不动学进去。
- 幻觉的根源因为模型学的是"什么词后面该接什么词",而不是"什么是真的"——所以它会一本正经地编造看似合理但错误的内容。
自监督 vs 人类学习
人类学习其实也很"自监督"——小孩不需要老师告诉他"这是桌子、这是椅子",他自己观察世界就懂了。
但人类比 AI 强的地方在于:人类有身体,能摸、能尝、能跌倒——这就是"具身智能"(Embodied AI)想补的课。今天的大模型只有"读"的能力,没有"体验"的能力。
自监督学习 = "让数据自己教自己"。它是 2018 年之后最重要的范式突破——没有它,就没有 GPT、没有 ChatGPT、没有今天的大模型时代。
下一篇我们看 ML 的三个基础概念——特征、标签、过拟合。