有些选择会改变接下来能看到什么、能做什么。游戏里现在拿到一小份奖励,可能错过后面的机会;机器人某一步动作也会影响后续能不能完成任务。强化学习研究怎样利用交互反馈学会行动。
强化学习关心一串行动怎样得到好的结果。模型每次看到环境给出的观察,选一个动作,再收到新的观察和奖励;眼前得分高,未必最后做得好。它适合游戏决策、机器人控制等需要反复交互的问题,也被用于语言模型的后训练。
入门时先分清两件事:怎样判断一个动作值得做,怎样根据这个判断改变行动。价值学习、策略优化和两者结合的 Actor–Critic 是几种常见思路。再去看数据从哪里来、能否重复利用、奖励怎样定义,就能理解算法差异落在哪里。
- 在当前收益与未来机会之间做选择,例如游戏中是否先收集资源。
- 在连续动作空间里学控制,例如给关节施加多大的力。
- 用任务反馈改进已有策略,例如根据答案是否通过验证来调整生成行为。
先把状态、动作、奖励和数据来源写清楚,再选算法;训练曲线升高之后,还要看策略到底学会了什么。
- 01探索与回报
- 02估计状态价值
- 03形成行动策略
- 04执行策略
发展路线与代表工作
- 2015
- 2017
- 2018
关键概念
- 策略 · Policy
- 根据观察选择动作的规则,可以输出一个确定动作,也可以输出动作的概率分布。
- 奖励与回报 · Reward / Return
- 奖励是某一步的反馈;回报把后续奖励累积起来,常用折扣降低远期奖励的权重。
- 价值 · Value
- 在某个状态,或先做某个动作之后,按一定策略继续行动能获得多少预期回报。
- On-policy / Off-policy
- 前者主要用当前策略附近采集的数据更新;后者能学习来自其他策略或旧策略的经验。
状态、动作、奖励与一次交互
用动手学强化学习认识状态、动作、奖励、回报和策略,再看 Gymnasium Basic Usage 中观察与动作怎样流动。
先追踪一次运行:环境给了什么,策略选了什么,环境怎样变化,一次任务何时结束。能把这一轮讲清楚,再看算法怎样利用这些记录更新。
价值估计与策略优化
一条路线是估计某种处境或动作以后能得到多少回报,另一条路线是直接调整选动作的策略。它们在很多算法中会结合。
读到期望和条件概率,去数学基础补;读到神经网络训练,再回 DL。接着选 CleanRL 中一个适合自己的实现,把更新公式与代码对应起来。
想系统深入,进入 Berkeley 深度强化学习课程;偏好中文的另一种讲法,可以看 Easy RL。
强化学习的几条研究路线
同样是根据反馈改进策略,语言模型输出的是 token,Agent 会调用工具,人形机器人要控制关节。这些方向共享一些算法,也有各自的数据、环境和评测方式。下面按研究问题找入口;Model-based、离线学习等方法,也可以用于机器人和其他任务。
语言模型后训练:让回答更符合目标
模型已经会生成文字,接下来怎样让它遵循指令、解对题目?RL 可以用人类偏好训练出的奖励模型,也可以用答案或程序测试提供可验证的反馈。这里要看清奖励来自哪里,以及高奖励是否对应更好的回答。
- InstructGPT:从人工示范、偏好比较到奖励模型与策略优化,认识 RLHF 的训练流程。
- DeepSeek-R1:看推理任务的奖励设计,以及 R1-Zero 与 R1 不同的训练流程。
- verl:沿着采样回答、计算奖励、更新策略的过程读实现。模型报告的更多入口在 LLM 页。
Agentic RL:学会在多轮交互中完成任务
Agent 的一次行动可能是搜索、执行代码或操作界面,工具返回的结果又会影响下一步。训练需要处理整段交互:哪一步带来了最终成功,错误怎样累积,模型是否学会了合理使用工具。
读时追踪一条完整轨迹:哪些内容由模型生成,哪些来自环境,奖励在什么时候给出。工具调用与任务执行的基础放在 Agent 页。
人形机器人:从运动控制到 Sim-to-Real
站稳、行走、跟随动作乃至全身协同,需要策略连续控制身体。训练常在仿真中进行,再迁移到真机;接触、延迟和动力学差异都会影响表现。重点是观察量、动作表示、奖励,以及仿真与现实怎样对齐。
- Humanoid-Gym:从人形机器人运动控制认识仿真训练与零样本 Sim-to-Real 迁移。
- ASAP:通过对齐仿真与真实动力学,学习敏捷的全身动作。
- Unitree RL Gym:对照机器人配置、训练环境和部署代码看一套控制流程。操作任务与 VLA 模型接着看具身智能。
Model-based RL:预测行动的后果
先学习环境怎样随动作变化,再用这个模型训练策略或规划行动。模型可以在潜空间里预测,不必生成一张清晰图片。需要分清两件事:策略是否在想象轨迹中学习,执行时是否还会搜索候选动作。
更广的预测、视频模拟与交互环境见世界模型。
离线 RL:从已有交互数据学习
当真机试错昂贵,或只能使用已经收集的数据时,就需要从固定数据集中学习策略。行为克隆直接模仿数据里的动作;离线 RL 还利用奖励与长期回报,但要处理策略偏离数据分布后的价值估计问题。
阅读时留意数据由什么策略收集、覆盖哪些行为,以及论文怎样评估超出示范水平的改进。
多智能体 RL:多个决策者怎样协作
多个智能体同时行动时,每个个体看到的信息可能不完整,其他个体的策略也在变化。合作、竞争、通信和信用分配都由此出现;共享团队奖励时,怎样判断每个个体的贡献尤其重要。
LLM 多 Agent 系统也涉及协作;其中是否使用 RL,要看策略有没有通过交互奖励训练。
改变奖励,观察策略
在同一个小环境里保留配置,重复运行,看看训练曲线与最终表现是否一致。然后改一个奖励设置,观察策略是否出现你没预料到的行为。结果异常时,先回到轨迹,看实际发生了什么。
强化学习教材、实现与项目
中文教材、小环境、实现和深入课程收在强化学习资料目录。遇到机器人与控制问题,也可以去课题组入口找相关项目。
代表论文
先读 DQN 的交互与更新过程,再比较 PPO、SAC 如何用数据;第一遍能说清各自学什么、用什么数据就很有收获。