机器学习 · ML 篇
机器学习(Machine Learning)是 AI 大圈里的一个具体流派,也是今天几乎所有"看起来智能"的产品的底子。它的核心思想只有一句:不写规则,让机器从数据里自己找规律。
你第一次挑西瓜完全靠猜。挑了 100 个瓜,每次回家切开,你记下:敲起来闷响 + 底部黄 + 瓜蒂卷——大概率甜。慢慢地,下一次你不用切就能挑出好瓜。
整个过程里:100 个瓜的经验是"数据",你脑子里那套规律是"模型",能挑出没切过的新瓜是"泛化能力"。
ML 和传统编程的最大区别
| 传统编程 | 机器学习 | |
|---|---|---|
| 输入 | 数据 + 规则 | 数据 + 答案 |
| 输出 | 结果 | 规则(模型) |
| 规则来源 | 程序员写 | 机器自己找 |
| 擅长 | 逻辑清晰、规则明确的问题 | 规则模糊、样本丰富的问题 |
机器学习的四大流派
监督学习 · Supervised
你给:数据 + 标准答案。
它学:输入 → 输出的映射。
例:垃圾邮件识别、房价预测、看片诊断。
无监督学习 · Unsupervised
你给:只有数据,没有答案。
它学:数据里的结构、群体、异常。
例:用户分群、异常检测、话题聚类。
强化学习 · Reinforcement
你给:一个环境 + 奖励/惩罚。
它学:在环境里"怎么做能得高分"。
例:下棋 AI、机器人控制、自动驾驶。
自监督学习 · Self-Supervised
你给:只给数据,自己造答案。
它学:数据的深层表征。
例:大语言模型的预训练(今天的主流)。
监督学习:老师每题都给标答,你对着改。
无监督学习:老师不给答案,只把一堆卷子放你面前,让你自己分类。
强化学习:老师不讲课,只在你做对时说"好"、做错时说"不好",你自己摸索。
自监督学习:老师撕掉一半试卷让你补全另一半——不需要额外标注,就能从原文本里"自问自答"。
机器学习的四步流程
1. 准备数据
收集样本、清洗噪音、划分训练集和测试集。数据决定天花板,模型只是逼近。
2. 选一个模型
线性回归、决策树、神经网络——本质都是"一个带参数的函数"。参数就是模型要学的东西。
3. 训练
把训练数据喂进去,让模型不断修正参数,让预测和答案的差距(损失)尽可能小。
4. 评估
拿测试集打分。考得好说明"泛化"了;只在训练集上好叫过拟合——死记硬背而已。
三个必须知道的术语
- 特征 · Feature喂给模型的"输入维度"。挑西瓜时"响声、颜色、瓜蒂"就是三个特征。
- 标签 · Label你希望模型学到的"正确答案"。切开后的"甜/不甜"就是标签。
- 过拟合 · Overfit在训练集上完美、遇到新数据就傻。像只会做他做过的题的人。
ML 的经典算法("传统 ML"vs 深度学习)
在深度学习火起来之前,机器学习的主力是一批更"轻量"的经典算法——今天在很多工业场景里仍然是首选(数据不够、要求可解释、算力有限时用这些):
| 算法 | 擅长 | 今天用在哪 |
|---|---|---|
| 线性回归 / 逻辑回归 | 简单预测和分类 | 信用评分、风控基线 |
| 决策树 / 随机森林 | 可解释的规则 | 金融风控、医学辅助诊断 |
| SVM 支持向量机 | 中等规模分类 | 文本分类、生物识别 |
| K-Means 聚类 | 把数据自动分群 | 用户分群、图片压缩 |
| XGBoost / LightGBM | 结构化数据王者 | Kaggle 比赛、推荐、广告 |
机器学习的核心是"给经验,学规律,用规律"。今天再复杂的 AI(包括大模型),底子上都是这三个字:学·验·用。