§ 4.3 · Sub-chapter

强化学习篇

Reinforcement Learning

监督学习需要"标准答案",无监督学习需要"数据结构"。强化学习走的是第三条路——不给答案,也不给现成数据,只给你一个"环境"和"奖励规则",让你自己摸索怎么赢。这是下棋 AI、自动驾驶、机器人走路用的方法。

生活场景
🐶 训练一只小狗学"坐下"

你说"坐下"——小狗不知道啥意思,乱动。
它偶然屁股着地——你立刻给一块零食。
反复几次,小狗慢慢明白:坐下 = 有零食吃。下次你一喊"坐下",它立刻坐。
小狗并没有"学过坐下的标准动作"——它是通过"奖励 / 没奖励"的信号,自己总结出了"什么动作能得奖励"
这就是强化学习的核心逻辑。

强化学习的五个角色

概念中文例子(训练小狗)
Agent智能体小狗
Environment环境你家客厅 + 你
State状态小狗当前站着 / 趴着 / 歪头
Action动作坐下、趴下、摇尾巴、汪汪叫
Reward奖励给零食 +1 / 没零食 0

核心循环

1. 智能体观察环境

小狗看到你说"坐下"。当前状态 = "站着,主人发指令了"。

2. 选一个动作

小狗根据它"当前的策略"选个动作——早期是乱选,慢慢有偏好。

3. 环境给反馈

你给零食(正奖励)或没反应(零奖励)。

4. 智能体更新策略

小狗记下"刚才这个动作得了奖励"——下次类似状态再选这个动作的概率提高。

5. 重复一万次

策略越来越好,小狗变成"听话的小狗"。

和监督学习的关键区别

监督学习强化学习
反馈类型标准答案(立即、精确)奖励信号(可能延迟、模糊)
目标预测正确累计奖励最大
数据人工标注自己探索产生
影响一次预测,互不影响当前动作影响后续状态
典型应用识别、分类、预测下棋、机器人、自动驾驶

探索 vs 利用 · 一对永恒矛盾

强化学习里有一对经典矛盾——探索(Exploration)和利用(Exploitation)

探索

试试新动作

小狗偶尔试试"歪头"——也许主人更喜欢?也许更差?不试不知道。

利用

用已验证的动作

小狗坐下拿过零食——那就一直坐下,稳妥拿零食。

只探索,永远在乱试,学不会;只利用,可能陷入局部最优,错过更好的策略。好的强化学习算法要在两者之间平衡——常见做法:早期多探索,后期多利用。

Analogy · 你点外卖的策略

你到新城市——是每天试一家新店(探索),还是只吃你已经觉得好吃的那家(利用)?
只试新店:可能踩雷无数次。
只吃老店:可能错过更惊艳的味道。
最好的策略:先多试,找到几家不错的,再轮换着吃。

强化学习的经典案例

年份系统成就
2013DQN (DeepMind)让 AI 自己学会玩 49 种 Atari 老游戏,部分超过人类
2016AlphaGo击败李世石,围棋被攻陷
2017AlphaZero不看任何人类棋谱,纯自我对弈,4 小时从零到超越 AlphaGo
2019AlphaStar星际争霸 II 击败顶级职业选手
2022ChatGPT (RLHF)用人类反馈强化学习让大模型"更懂人心"
2024o1 / R1用强化学习让大模型学会"停下来多想几步"

强化学习 + 大模型 · 2024 年的新故事

2024 年之后,强化学习重新火起来——不是因为新游戏,而是因为它让大模型"会思考"。推理模型(OpenAI o1、DeepSeek-R1)的核心就是:

模型不停尝试不同的"思考路径"——得到正确答案的奖励高,错误答案的奖励低。训练几万次之后,模型就学会了"先列条件、再分步推理、最后给答案"的好习惯。这是强化学习 2024 年之后最重要的应用。

强化学习的挑战

强化学习在你生活中

应用强化学习在做什么
自动驾驶环境 = 路况;动作 = 油门刹车转向;奖励 = 安全高效
推荐系统环境 = 用户行为;动作 = 推哪条内容;奖励 = 用户停留/点击
仓库机器人环境 = 仓库布局;动作 = 移动/抓取;奖励 = 取货速度
游戏 AIDOTA、星际、围棋、扑克——大量突破都靠 RL
大模型对齐RLHF——让 AI 的回答更"讨人喜欢"
Recap · 收束

强化学习 = "用奖励信号引导学习"。它是 AI 学会"做决策"的主要方式,跟监督学习"学映射"、无监督学习"找结构"并列,构成机器学习的三大流派。
下一篇我们看 2024 年之后最重要的范式——自监督学习

☰ 主页
Xue Hai Wu Ya · § 4.3 · Reinforcement Learning