§ 2.2 · Sub-chapter

机器学习 · ML 篇

Machine Learning

机器学习(Machine Learning)是 AI 大圈里的一个具体流派,也是今天几乎所有"看起来智能"的产品的底子。它的核心思想只有一句:不写规则,让机器从数据里自己找规律。

生活场景
🍉 你去菜市场挑西瓜

你第一次挑西瓜完全靠猜。挑了 100 个瓜,每次回家切开,你记下:敲起来闷响 + 底部黄 + 瓜蒂卷——大概率甜。慢慢地,下一次你不用切就能挑出好瓜。

整个过程里:100 个瓜的经验是"数据",你脑子里那套规律是"模型",能挑出没切过的新瓜是"泛化能力"。

ML 和传统编程的最大区别

传统编程机器学习
输入数据 + 规则数据 + 答案
输出结果规则(模型)
规则来源程序员写机器自己找
擅长逻辑清晰、规则明确的问题规则模糊、样本丰富的问题

机器学习的四大流派

01

监督学习 · Supervised

你给:数据 + 标准答案。
它学:输入 → 输出的映射。
例:垃圾邮件识别、房价预测、看片诊断。

02

无监督学习 · Unsupervised

你给:只有数据,没有答案。
它学:数据里的结构、群体、异常。
例:用户分群、异常检测、话题聚类。

03

强化学习 · Reinforcement

你给:一个环境 + 奖励/惩罚。
它学:在环境里"怎么做能得高分"。
例:下棋 AI、机器人控制、自动驾驶。

04

自监督学习 · Self-Supervised

你给:只给数据,自己造答案。
它学:数据的深层表征。
例:大语言模型的预训练(今天的主流)。

Analogy · 四种老师

监督学习:老师每题都给标答,你对着改。
无监督学习:老师不给答案,只把一堆卷子放你面前,让你自己分类。
强化学习:老师不讲课,只在你做对时说"好"、做错时说"不好",你自己摸索。
自监督学习:老师撕掉一半试卷让你补全另一半——不需要额外标注,就能从原文本里"自问自答"。

机器学习的四步流程

1. 准备数据

收集样本、清洗噪音、划分训练集和测试集。数据决定天花板,模型只是逼近。

2. 选一个模型

线性回归、决策树、神经网络——本质都是"一个带参数的函数"。参数就是模型要学的东西。

3. 训练

把训练数据喂进去,让模型不断修正参数,让预测和答案的差距(损失)尽可能小。

4. 评估

拿测试集打分。考得好说明"泛化"了;只在训练集上好叫过拟合——死记硬背而已。

三个必须知道的术语

ML 的经典算法("传统 ML"vs 深度学习)

在深度学习火起来之前,机器学习的主力是一批更"轻量"的经典算法——今天在很多工业场景里仍然是首选(数据不够、要求可解释、算力有限时用这些):

算法擅长今天用在哪
线性回归 / 逻辑回归简单预测和分类信用评分、风控基线
决策树 / 随机森林可解释的规则金融风控、医学辅助诊断
SVM 支持向量机中等规模分类文本分类、生物识别
K-Means 聚类把数据自动分群用户分群、图片压缩
XGBoost / LightGBM结构化数据王者Kaggle 比赛、推荐、广告
Recap · 收束

机器学习的核心是"给经验,学规律,用规律"。今天再复杂的 AI(包括大模型),底子上都是这三个字:··

☰ 主页
Xue Hai Wu Ya · § 2.2 · ML