§ 4.5 · Sub-chapter

特征 / 标签 / 过拟合篇

Features, Labels & Overfitting

机器学习的三个最基础术语——特征、标签、过拟合——理解了它们,你就理解了 ML 的"地基"。这一篇不讲故事,直接拆概念。

特征 · Feature

特征是喂给模型的"输入维度"——每个样本用一组数字来描述。挑西瓜时"响声、颜色、瓜蒂"就是三个特征。

生活场景
🏥 体检报告

你去医院体检,报告上有:身高、体重、血压、血糖、胆固醇、心率、白细胞……
每一项就是一个特征。医生根据这些特征判断你"健康 / 亚健康 / 有病"。
机器学习也一样——每个样本用一组特征描述,模型根据特征做判断。

特征工程 · 最难也最重要的事

特征工程(Feature Engineering)是"从原始数据里提取有用特征"的过程。传统 ML 时代,80% 的工作量在特征工程上。

原始数据提取的特征为什么有用
用户注册时间注册距今多少天新用户和老用户行为不同
交易时间戳是否周末、是否凌晨盗刷多在凌晨
一段文本长度、感叹号数量、关键词垃圾邮件通常很长、很多感叹号
一张图片颜色直方图、边缘密度猫和狗的纹理不同
Analogy · 做菜 vs 吃菜

特征工程 = 做菜——你把生食材(原始数据)切成丝、片、丁(特征),厨师(模型)才能炒出好菜。
深度学习 = 自动做菜——你直接把整只鸡扔进锅,神经网络自己学会"怎么切"。
这就是深度学习最大的突破:它把特征工程自动化了

标签 · Label

标签是你希望模型学到的"正确答案"。监督学习里,每个样本必须带标签。

任务标签长什么样
分类"猫" / "狗" / "垃圾" / "正常"
回归412.5(万元)/ 23.7(℃)/ 156(ms)
目标检测每个物体的类别 + 位置框
语义分割每个像素的类别

标签的成本

标注是 ML 最贵的环节之一。一张医疗影像要资深医生标,一张 5 块钱;一辆自动驾驶汽车的路测数据,要人工框出每一帧的行人、车辆、红绿灯——一帧几毛钱,一天几十万帧。

这就是为什么自监督学习(§ 4.4)这么火——它绕开了标注

过拟合 · Overfitting

过拟合是 ML 里最经典、最致命的问题——模型在训练集上表现完美,遇到新数据就傻

生活场景
📝 只会做他做过的题

一个学生,你把过去 10 年的高考题给他背。他背得滚瓜烂熟,你随便抽一道他都能默写出答案。
你很开心,觉得他数学满分稳了。
结果高考那天,题目稍微变了个形式——他一道都不会。
他不是"学会了数学",他是"背会了那 100 道题"。
这就是过拟合。

过拟合 vs 欠拟合

欠拟合 · Underfit过拟合 · Overfit
训练集表现完美
测试集表现
原因模型太简单,学不到规律模型太复杂,把噪音当规律
类比学生没复习,考砸了学生只背题,换题就傻
解决加特征、换复杂模型加数据、减复杂度、正则化

怎么判断过拟合了

训练过程中画两条曲线——训练误差验证误差

怎么防止过拟合

01

更多数据

数据多了,模型没法"全背下来"——被迫学真规律。这是最根本的方法。

02

正则化 · Regularization

给模型参数加"惩罚",不让它变得太极端。L1 / L2 是经典方法。

03

Dropout

训练时随机"关掉"一部分神经元——强迫模型不依赖单一路径。深度学习标配。

04

早停 · Early Stopping

验证误差开始上升就停——不让模型继续"背"下去。

Analogy · 防过拟合 = 防死记硬背

老师防学生死记硬背的方法:
出更多题(更多数据)——题量大了背不完;
出变形题(数据增强)——换个角度考,背题就失效;
限时交卷(早停)——不给你无限时间磨;
随机抽查(Dropout)——不知道考哪题,必须全会。

三个术语的关系

把这三个词串起来,就是 ML 的完整工作流:

1. 收集数据

每个样本 = 特征(输入)+ 标签(答案)。

2. 选模型、训练

模型从特征里学规律,尽量预测对标签。

3. 评估

在没见过的数据上测试——如果表现差,可能是过拟合了。

4. 调优

加数据 / 减复杂度 / 正则化——直到模型在训练集和测试集上都表现好。

Recap · 收束

特征是输入,标签是答案,过拟合是"背题不学真"。这三个词是 ML 的 ABC——后面所有章节都会用到
第 4 章 · 机器学习篇到此结束。下一章我们进入"神经网络"——深度学习的心脏。

☰ 主页
Xue Hai Wu Ya · § 4.5 · Features, Labels & Overfitting