Chapter · 04

第 4 章 · 机器学习篇

Machine Learning · How Machines Learn

机器学习是 AI 大圈里的一个具体流派,也是今天几乎所有"看起来智能"的产品的底子。它的核心思想只有一句:不写规则,让机器从数据里自己找规律。这一章,我们从最日常的"挑西瓜"开始,把这件事讲透。

生活场景
🍉 你去菜市场挑西瓜

你第一次挑西瓜完全靠猜。挑了 100 个瓜,每次回家切开,你记下:敲起来闷响 + 底部黄 + 瓜蒂卷——大概率甜。慢慢地,下一次你不用切就能挑出好瓜。

整个过程里:100 个瓜的经验是"数据",你脑子里那套规律是"模型",能挑出没切过的新瓜是"泛化能力"。

ML 和传统编程的本质区别

传统编程是"我给你规则,你给我结果";机器学习是"我给你数据和答案,你给我规则"。方向反过来了。

传统编程机器学习
输入数据 + 规则数据 + 答案
输出结果规则(模型)
规则来源程序员写机器自己找
擅长逻辑清晰、规则明确规则模糊、样本丰富

本章的五个子篇

机器学习看似玄学,其实就能拆成五种"玩法"+ 三个核心概念。这一章分五篇,一篇一篇讲:

§ 4.1

监督学习篇

最主流的一种——你给数据+答案,它学"输入→输出"。

§ 4.2

无监督学习篇

只给数据,不给答案——它自己找"结构、群体、异常"。

§ 4.3

强化学习篇

给环境和奖励——它学"怎么做能得高分"。下棋、自动驾驶都靠它。

§ 4.4

自监督学习篇

不依赖人工标注,让机器自己造答案——今天大模型的核心方法。

§ 4.5

特征 / 标签 / 过拟合篇

三个最基础也最重要的术语——理解它们就理解了 ML 的"地基"。

机器学习的四步流程

不管是哪种 ML,工作流都大同小异:

1. 准备数据

收集样本、清洗噪音、划分训练集和测试集。数据决定天花板,模型只是逼近。

2. 选一个模型

线性回归、决策树、神经网络——本质都是"一个带参数的函数"。参数就是模型要学的东西。

3. 训练

把训练数据喂进去,让模型不断修正参数,让预测和答案的差距(损失)尽可能小。

4. 评估

拿测试集打分。考得好说明"泛化"了;只在训练集上好叫过拟合——死记硬背而已。

什么时候用机器学习?什么时候不用?

适合 ML

规则模糊、样本丰富

识别猫、推荐商品、翻译句子、风控判断、医疗影像——这些都很难写成规则,但样本多得是。

不适合 ML

规则清晰、样本少

计算利息、判断闰年、发工资——这些规则一句话写清,没必要 ML;样本太少 ML 也学不出来。

Recap · 收束

机器学习 = "给经验,学规律,用规律"今天再复杂的 AI(包括大模型),底子上都是这三个字:学 · 验 · 用。理解这一章,后面所有章节都是它的延伸。

☰ 主页
Xue Hai Wu Ya · Chapter 04 · Machine Learning