第 4 章 · 机器学习篇
机器学习是 AI 大圈里的一个具体流派,也是今天几乎所有"看起来智能"的产品的底子。它的核心思想只有一句:不写规则,让机器从数据里自己找规律。这一章,我们从最日常的"挑西瓜"开始,把这件事讲透。
你第一次挑西瓜完全靠猜。挑了 100 个瓜,每次回家切开,你记下:敲起来闷响 + 底部黄 + 瓜蒂卷——大概率甜。慢慢地,下一次你不用切就能挑出好瓜。
整个过程里:100 个瓜的经验是"数据",你脑子里那套规律是"模型",能挑出没切过的新瓜是"泛化能力"。
ML 和传统编程的本质区别
传统编程是"我给你规则,你给我结果";机器学习是"我给你数据和答案,你给我规则"。方向反过来了。
| 传统编程 | 机器学习 | |
|---|---|---|
| 输入 | 数据 + 规则 | 数据 + 答案 |
| 输出 | 结果 | 规则(模型) |
| 规则来源 | 程序员写 | 机器自己找 |
| 擅长 | 逻辑清晰、规则明确 | 规则模糊、样本丰富 |
本章的五个子篇
机器学习看似玄学,其实就能拆成五种"玩法"+ 三个核心概念。这一章分五篇,一篇一篇讲:
监督学习篇
最主流的一种——你给数据+答案,它学"输入→输出"。
无监督学习篇
只给数据,不给答案——它自己找"结构、群体、异常"。
强化学习篇
给环境和奖励——它学"怎么做能得高分"。下棋、自动驾驶都靠它。
自监督学习篇
不依赖人工标注,让机器自己造答案——今天大模型的核心方法。
特征 / 标签 / 过拟合篇
三个最基础也最重要的术语——理解它们就理解了 ML 的"地基"。
机器学习的四步流程
不管是哪种 ML,工作流都大同小异:
1. 准备数据
收集样本、清洗噪音、划分训练集和测试集。数据决定天花板,模型只是逼近。
2. 选一个模型
线性回归、决策树、神经网络——本质都是"一个带参数的函数"。参数就是模型要学的东西。
3. 训练
把训练数据喂进去,让模型不断修正参数,让预测和答案的差距(损失)尽可能小。
4. 评估
拿测试集打分。考得好说明"泛化"了;只在训练集上好叫过拟合——死记硬背而已。
什么时候用机器学习?什么时候不用?
规则模糊、样本丰富
识别猫、推荐商品、翻译句子、风控判断、医疗影像——这些都很难写成规则,但样本多得是。
规则清晰、样本少
计算利息、判断闰年、发工资——这些规则一句话写清,没必要 ML;样本太少 ML 也学不出来。
机器学习 = "给经验,学规律,用规律"。今天再复杂的 AI(包括大模型),底子上都是这三个字:学 · 验 · 用。理解这一章,后面所有章节都是它的延伸。