特征 / 标签 / 过拟合篇
机器学习的三个最基础术语——特征、标签、过拟合——理解了它们,你就理解了 ML 的"地基"。这一篇不讲故事,直接拆概念。
特征 · Feature
特征是喂给模型的"输入维度"——每个样本用一组数字来描述。挑西瓜时"响声、颜色、瓜蒂"就是三个特征。
你去医院体检,报告上有:身高、体重、血压、血糖、胆固醇、心率、白细胞……
每一项就是一个特征。医生根据这些特征判断你"健康 / 亚健康 / 有病"。
机器学习也一样——每个样本用一组特征描述,模型根据特征做判断。
特征工程 · 最难也最重要的事
特征工程(Feature Engineering)是"从原始数据里提取有用特征"的过程。传统 ML 时代,80% 的工作量在特征工程上。
| 原始数据 | 提取的特征 | 为什么有用 |
|---|---|---|
| 用户注册时间 | 注册距今多少天 | 新用户和老用户行为不同 |
| 交易时间戳 | 是否周末、是否凌晨 | 盗刷多在凌晨 |
| 一段文本 | 长度、感叹号数量、关键词 | 垃圾邮件通常很长、很多感叹号 |
| 一张图片 | 颜色直方图、边缘密度 | 猫和狗的纹理不同 |
特征工程 = 做菜——你把生食材(原始数据)切成丝、片、丁(特征),厨师(模型)才能炒出好菜。
深度学习 = 自动做菜——你直接把整只鸡扔进锅,神经网络自己学会"怎么切"。
这就是深度学习最大的突破:它把特征工程自动化了。
标签 · Label
标签是你希望模型学到的"正确答案"。监督学习里,每个样本必须带标签。
| 任务 | 标签长什么样 |
|---|---|
| 分类 | "猫" / "狗" / "垃圾" / "正常" |
| 回归 | 412.5(万元)/ 23.7(℃)/ 156(ms) |
| 目标检测 | 每个物体的类别 + 位置框 |
| 语义分割 | 每个像素的类别 |
标签的成本
标注是 ML 最贵的环节之一。一张医疗影像要资深医生标,一张 5 块钱;一辆自动驾驶汽车的路测数据,要人工框出每一帧的行人、车辆、红绿灯——一帧几毛钱,一天几十万帧。
这就是为什么自监督学习(§ 4.4)这么火——它绕开了标注。
过拟合 · Overfitting
过拟合是 ML 里最经典、最致命的问题——模型在训练集上表现完美,遇到新数据就傻。
一个学生,你把过去 10 年的高考题给他背。他背得滚瓜烂熟,你随便抽一道他都能默写出答案。
你很开心,觉得他数学满分稳了。
结果高考那天,题目稍微变了个形式——他一道都不会。
他不是"学会了数学",他是"背会了那 100 道题"。
这就是过拟合。
过拟合 vs 欠拟合
| 欠拟合 · Underfit | 过拟合 · Overfit | |
|---|---|---|
| 训练集表现 | 差 | 完美 |
| 测试集表现 | 差 | 差 |
| 原因 | 模型太简单,学不到规律 | 模型太复杂,把噪音当规律 |
| 类比 | 学生没复习,考砸了 | 学生只背题,换题就傻 |
| 解决 | 加特征、换复杂模型 | 加数据、减复杂度、正则化 |
怎么判断过拟合了
训练过程中画两条曲线——训练误差和验证误差:
- 训练误差 ↓ 验证误差 ↓正常——模型在学真规律。
- 训练误差 ↓ 验证误差 ↑过拟合了——模型在"背"训练集。
- 两条都高欠拟合——模型太简单。
怎么防止过拟合
更多数据
数据多了,模型没法"全背下来"——被迫学真规律。这是最根本的方法。
正则化 · Regularization
给模型参数加"惩罚",不让它变得太极端。L1 / L2 是经典方法。
Dropout
训练时随机"关掉"一部分神经元——强迫模型不依赖单一路径。深度学习标配。
早停 · Early Stopping
验证误差开始上升就停——不让模型继续"背"下去。
老师防学生死记硬背的方法:
① 出更多题(更多数据)——题量大了背不完;
② 出变形题(数据增强)——换个角度考,背题就失效;
③ 限时交卷(早停)——不给你无限时间磨;
④ 随机抽查(Dropout)——不知道考哪题,必须全会。
三个术语的关系
把这三个词串起来,就是 ML 的完整工作流:
1. 收集数据
每个样本 = 特征(输入)+ 标签(答案)。
2. 选模型、训练
模型从特征里学规律,尽量预测对标签。
3. 评估
在没见过的数据上测试——如果表现差,可能是过拟合了。
4. 调优
加数据 / 减复杂度 / 正则化——直到模型在训练集和测试集上都表现好。
特征是输入,标签是答案,过拟合是"背题不学真"。这三个词是 ML 的 ABC——后面所有章节都会用到。
第 4 章 · 机器学习篇到此结束。下一章我们进入"神经网络"——深度学习的心脏。