无监督学习篇
监督学习需要"老师标答案"。但现实中90% 的数据根本没有答案——一堆用户行为日志、一堆图片、一堆网页。无监督学习做的事:不给答案,让机器自己找出"这里面有什么规律"。
你妈把一堆衣服扔给你:"分个类。" 她没说怎么分。
你看着这堆衣服,凭直觉把它们分成——
① 夏装一堆:短袖、短裤、背心
② 冬装一堆:羽绒服、毛衣
③ 内衣一堆:袜子、内裤
④ 配饰一堆:围巾、帽子
没有人告诉你"该按季节分"——但衣服本身的特征让你自己找出了"分组"。这就是无监督学习做的事。
和监督学习的对比
| 监督学习 | 无监督学习 | |
|---|---|---|
| 输入 | 数据 + 标准答案 | 只有数据 |
| 目标 | 学"输入→输出"映射 | 发现数据中的"结构" |
| 典型任务 | 分类、回归 | 聚类、降维、异常检测 |
| 评价 | 准确率(跟标准答案对) | 较难量化(看结果合不合理) |
无监督学习的三大任务
聚类 · Clustering
把相似的东西自动分组——比如把 10 万用户按消费习惯分成 5 类,对每类做不同营销。
常用算法:K-Means、DBSCAN、层次聚类。
降维 · Dimensionality Reduction
把"太多特征"压缩成"少数核心特征"——比如把 1000 个商品特征压成 3 个,方便可视化。
常用算法:PCA、t-SNE、UMAP。
异常检测 · Anomaly Detection
找出"跟正常不一样"的样本——比如信用卡盗刷、机器故障、网络入侵。
常用算法:Isolation Forest、Autoencoder。
聚类详解 · 怎么"自动分组"
拿最经典的 K-Means 举例,看它怎么把一堆用户分成 K 组:
1. 你指定 K = 3
"我想把这些用户分成 3 类。"K-Means 先在数据里随机选 3 个"中心点"。
2. 每个用户归属最近的中心
每个用户(由消费金额、频次、品类等特征组成的"向量")找到离自己最近的中心,归到那一组。
3. 重新计算中心
每组用户的平均值成为新的中心。回到第 2 步。
4. 收敛
重复若干次,中心不再变化——分好了。
体育老师让全班 30 人"按体型自由分成 3 组"。
一开始大家乱站。老师让每组选个"组长",然后每个人"看哪个组长跟自己最像"——重新归到那一组。
然后再换"新组长"(最能代表这一组的人)。几轮下来,自动分成了"高瘦组 / 中等组 / 矮胖组"——这就是 K-Means。
无监督学习在你生活中的样子
| 你做的事 | 背后的无监督学习 |
|---|---|
| 淘宝"猜你喜欢" | 用户聚类——把跟你品味相似的人买的东西推给你 |
| 抖音把视频分领域 | 内容聚类——自动把视频分成"美食 / 旅行 / 萌宠"…… |
| 银行风控发现盗刷 | 异常检测——你的卡突然在国外刷一笔大的,立刻冻结 |
| 新闻客户端自动归类 | 文本聚类——自动把新闻分成"体育 / 财经 / 娱乐"…… |
| 生物学家发现新物种 | 基因聚类——把相似基因型的个体归为一类 |
无监督学习的局限
- 结果不一定有用机器可能"自动分出 5 组",但这 5 组对应现实里的什么?要人去解读。
- 对参数敏感K-Means 让你指定 K——但你事先不知道"应该分几组"。试错的成本不低。
- 难以评估没有标准答案,"分得好不好"只能凭经验看。
为什么现在很少单独用"纯无监督"
纯粹的无监督学习今天用得越来越少——因为有更好的"变种":
- 半监督学习10% 标注 + 90% 不标注——机器利用未标注数据辅助学习。
- 自监督学习(§ 4.4 详讲)让机器自己造"伪答案"——比如让 AI 遮住句子里的词,让它猜遮住的词是什么。
- 对比学习让机器学"这两张是同一个东西" vs "那两张不是同一个东西"——图片搜索、人脸识别常用。
无监督学习 = "让机器自己在数据里找结构"。它是监督学习的好帮手,但今天最热的"自监督"已经把它推向了新高度——下一篇我们看强化学习。