§ 4.2 · Sub-chapter

无监督学习篇

Unsupervised Learning

监督学习需要"老师标答案"。但现实中90% 的数据根本没有答案——一堆用户行为日志、一堆图片、一堆网页。无监督学习做的事:不给答案,让机器自己找出"这里面有什么规律"

生活场景
🧺 妈妈让你整理衣柜

你妈把一堆衣服扔给你:"分个类。" 她没说怎么分。
你看着这堆衣服,凭直觉把它们分成——
① 夏装一堆:短袖、短裤、背心
② 冬装一堆:羽绒服、毛衣
③ 内衣一堆:袜子、内裤
④ 配饰一堆:围巾、帽子
没有人告诉你"该按季节分"——但衣服本身的特征让你自己找出了"分组"。这就是无监督学习做的事。

和监督学习的对比

监督学习无监督学习
输入数据 + 标准答案只有数据
目标学"输入→输出"映射发现数据中的"结构"
典型任务分类、回归聚类、降维、异常检测
评价准确率(跟标准答案对)较难量化(看结果合不合理)

无监督学习的三大任务

01

聚类 · Clustering

把相似的东西自动分组——比如把 10 万用户按消费习惯分成 5 类,对每类做不同营销。
常用算法:K-Means、DBSCAN、层次聚类。

02

降维 · Dimensionality Reduction

把"太多特征"压缩成"少数核心特征"——比如把 1000 个商品特征压成 3 个,方便可视化。
常用算法:PCA、t-SNE、UMAP。

03

异常检测 · Anomaly Detection

找出"跟正常不一样"的样本——比如信用卡盗刷、机器故障、网络入侵。
常用算法:Isolation Forest、Autoencoder。

聚类详解 · 怎么"自动分组"

拿最经典的 K-Means 举例,看它怎么把一堆用户分成 K 组:

1. 你指定 K = 3

"我想把这些用户分成 3 类。"K-Means 先在数据里随机选 3 个"中心点"。

2. 每个用户归属最近的中心

每个用户(由消费金额、频次、品类等特征组成的"向量")找到离自己最近的中心,归到那一组。

3. 重新计算中心

每组用户的平均值成为新的中心。回到第 2 步。

4. 收敛

重复若干次,中心不再变化——分好了。

Analogy · 自由分组

体育老师让全班 30 人"按体型自由分成 3 组"。
一开始大家乱站。老师让每组选个"组长",然后每个人"看哪个组长跟自己最像"——重新归到那一组。
然后再换"新组长"(最能代表这一组的人)。几轮下来,自动分成了"高瘦组 / 中等组 / 矮胖组"——这就是 K-Means。

无监督学习在你生活中的样子

你做的事背后的无监督学习
淘宝"猜你喜欢"用户聚类——把跟你品味相似的人买的东西推给你
抖音把视频分领域内容聚类——自动把视频分成"美食 / 旅行 / 萌宠"……
银行风控发现盗刷异常检测——你的卡突然在国外刷一笔大的,立刻冻结
新闻客户端自动归类文本聚类——自动把新闻分成"体育 / 财经 / 娱乐"……
生物学家发现新物种基因聚类——把相似基因型的个体归为一类

无监督学习的局限

为什么现在很少单独用"纯无监督"

纯粹的无监督学习今天用得越来越少——因为有更好的"变种":

Recap · 收束

无监督学习 = "让机器自己在数据里找结构"。它是监督学习的好帮手,但今天最热的"自监督"已经把它推向了新高度——下一篇我们看强化学习。

☰ 主页
Xue Hai Wu Ya · § 4.2 · Unsupervised Learning