强化学习篇
监督学习需要"标准答案",无监督学习需要"数据结构"。强化学习走的是第三条路——不给答案,也不给现成数据,只给你一个"环境"和"奖励规则",让你自己摸索怎么赢。这是下棋 AI、自动驾驶、机器人走路用的方法。
你说"坐下"——小狗不知道啥意思,乱动。
它偶然屁股着地——你立刻给一块零食。
反复几次,小狗慢慢明白:坐下 = 有零食吃。下次你一喊"坐下",它立刻坐。
小狗并没有"学过坐下的标准动作"——它是通过"奖励 / 没奖励"的信号,自己总结出了"什么动作能得奖励"。
这就是强化学习的核心逻辑。
强化学习的五个角色
| 概念 | 中文 | 例子(训练小狗) |
|---|---|---|
| Agent | 智能体 | 小狗 |
| Environment | 环境 | 你家客厅 + 你 |
| State | 状态 | 小狗当前站着 / 趴着 / 歪头 |
| Action | 动作 | 坐下、趴下、摇尾巴、汪汪叫 |
| Reward | 奖励 | 给零食 +1 / 没零食 0 |
核心循环
1. 智能体观察环境
小狗看到你说"坐下"。当前状态 = "站着,主人发指令了"。
2. 选一个动作
小狗根据它"当前的策略"选个动作——早期是乱选,慢慢有偏好。
3. 环境给反馈
你给零食(正奖励)或没反应(零奖励)。
4. 智能体更新策略
小狗记下"刚才这个动作得了奖励"——下次类似状态再选这个动作的概率提高。
5. 重复一万次
策略越来越好,小狗变成"听话的小狗"。
和监督学习的关键区别
| 监督学习 | 强化学习 | |
|---|---|---|
| 反馈类型 | 标准答案(立即、精确) | 奖励信号(可能延迟、模糊) |
| 目标 | 预测正确 | 累计奖励最大 |
| 数据 | 人工标注 | 自己探索产生 |
| 影响 | 一次预测,互不影响 | 当前动作影响后续状态 |
| 典型应用 | 识别、分类、预测 | 下棋、机器人、自动驾驶 |
探索 vs 利用 · 一对永恒矛盾
强化学习里有一对经典矛盾——探索(Exploration)和利用(Exploitation):
试试新动作
小狗偶尔试试"歪头"——也许主人更喜欢?也许更差?不试不知道。
用已验证的动作
小狗坐下拿过零食——那就一直坐下,稳妥拿零食。
只探索,永远在乱试,学不会;只利用,可能陷入局部最优,错过更好的策略。好的强化学习算法要在两者之间平衡——常见做法:早期多探索,后期多利用。
你到新城市——是每天试一家新店(探索),还是只吃你已经觉得好吃的那家(利用)?
只试新店:可能踩雷无数次。
只吃老店:可能错过更惊艳的味道。
最好的策略:先多试,找到几家不错的,再轮换着吃。
强化学习的经典案例
| 年份 | 系统 | 成就 |
|---|---|---|
| 2013 | DQN (DeepMind) | 让 AI 自己学会玩 49 种 Atari 老游戏,部分超过人类 |
| 2016 | AlphaGo | 击败李世石,围棋被攻陷 |
| 2017 | AlphaZero | 不看任何人类棋谱,纯自我对弈,4 小时从零到超越 AlphaGo |
| 2019 | AlphaStar | 星际争霸 II 击败顶级职业选手 |
| 2022 | ChatGPT (RLHF) | 用人类反馈强化学习让大模型"更懂人心" |
| 2024 | o1 / R1 | 用强化学习让大模型学会"停下来多想几步" |
强化学习 + 大模型 · 2024 年的新故事
2024 年之后,强化学习重新火起来——不是因为新游戏,而是因为它让大模型"会思考"。推理模型(OpenAI o1、DeepSeek-R1)的核心就是:
- 环境一道数学题 / 编程题
- 状态模型目前已经"想到"的中间步骤
- 动作生成下一个"想法"
- 奖励最终答案对不对
模型不停尝试不同的"思考路径"——得到正确答案的奖励高,错误答案的奖励低。训练几万次之后,模型就学会了"先列条件、再分步推理、最后给答案"的好习惯。这是强化学习 2024 年之后最重要的应用。
强化学习的挑战
- 样本效率低要"玩"几十万次才能学会——自动驾驶在真实世界试错代价太高,所以都在模拟器里训。
- 奖励难设计如果奖励设计错了,AI 会"钻空子"——比如让 AI 玩赛车游戏,结果它发现"撞墙卡住"也能拿分,就一直撞。
- 训练不稳定同样的代码跑两次,结果可能完全不同。调参非常玄学。
- 难以迁移在模拟器里学会的机器人走路,到真实世界可能完全不行——这叫"模拟到现实的鸿沟"(Sim-to-Real Gap)。
强化学习在你生活中
| 应用 | 强化学习在做什么 |
|---|---|
| 自动驾驶 | 环境 = 路况;动作 = 油门刹车转向;奖励 = 安全高效 |
| 推荐系统 | 环境 = 用户行为;动作 = 推哪条内容;奖励 = 用户停留/点击 |
| 仓库机器人 | 环境 = 仓库布局;动作 = 移动/抓取;奖励 = 取货速度 |
| 游戏 AI | DOTA、星际、围棋、扑克——大量突破都靠 RL |
| 大模型对齐 | RLHF——让 AI 的回答更"讨人喜欢" |
强化学习 = "用奖励信号引导学习"。它是 AI 学会"做决策"的主要方式,跟监督学习"学映射"、无监督学习"找结构"并列,构成机器学习的三大流派。
下一篇我们看 2024 年之后最重要的范式——自监督学习。