强化学习算法比较与学习路线
从数据、策略归属、动作空间、Replay、Target、保守性与偏好数据比较主要算法。
学习目标
- 定义强化学习算法比较与学习路线并复述输入输出。
- 从公式计算一个最小数值例子。
- 说明它与相邻算法的区别、失败模式和适用场景。
为什么重要
强化学习算法比较与学习路线位于“状态—行动—反馈—更新”学习链中的关键位置。
掌握它能帮助学习者判断算法使用的数据、策略归属和稳定性边界。
学习前需要掌握
背景与问题
强化学习面对序贯决策:动作会改变之后能看到的状态和奖励,因此样本通常并非独立同分布。
同一算法的效果取决于环境、探索策略、函数近似、随机种子和评测协议,单次曲线不足以下结论。
概念定义
比较页将 Q-Learning、SARSA、DQN、REINFORCE、Actor-Critic、A2C/A3C、DDPG、TD3、SAC、CQL、IQL、PPO、GRPO、DPO 放在同一决策框架。
本页使用“问题定义—数学目标—更新过程—代码—失败诊断”的顺序组织,避免只记算法缩写。
直观理解
先问数据从哪来、能否继续交互、学价值还是策略、动作空间是什么,再选算法。
把价值看作“未来累计收益的估计”,把策略看作“在状态下如何选动作的规则”;算法差异主要在估计谁、使用谁生成的数据以及如何更新。
核心原理
初学:GridWorld→Q-Learning→SARSA。
传统 RL:Bellman→DP→MC→TD。
深度 RL:DQN→Actor-Critic→PPO/SAC。
离线 RL:固定数据边界→分布偏移→行为约束→CQL/IQL→离线评测。
大模型对齐:Reward/Preference→PPO/GRPO/DPO 区别。
实践:固定协议、基线、多 seed、错误分析。
数学表达
折扣回报
当前回报由下一奖励与折扣后的未来回报组成。
变量含义
G_t从时刻 t 开始的折扣累计回报。R_{t+1}执行动作后收到的下一步奖励。γ折扣因子,通常位于 [0,1)。
计算步骤
- 1计算 bootstrap 目标:1+0.9×2=2.8。
- 2目标与当前估计差为 2.8−0.5=2.3。
- 3若学习率 α=0.1,新估计为 0.5+0.1×2.3=0.73。
代码对应位置
示例 1强化学习算法比较与学习路线的本地数值骨架:用确定性数组展示状态、更新和结果,不连接远程环境,也不在网页内执行。
变量解释
| 变量 | 含义 |
|---|---|
G_t | 从时刻 t 开始的折扣累计回报。 |
R_{t+1} | 执行动作后收到的下一步奖励。 |
γ | 折扣因子,通常位于 [0,1)。 |
完整数值示例
强化学习算法比较与学习路线的最小计算
已知条件
- 即时奖励为 1
- 下一状态估计为 2
- 折扣因子 γ=0.9
- 当前估计为 0.5
- 1
计算 bootstrap 目标:1+0.9×2=2.8。
- 2
目标与当前估计差为 2.8−0.5=2.3。
- 3
若学习率 α=0.1,新估计为 0.5+0.1×2.3=0.73。
一次更新后估计从 0.5 变为 0.73;是否收敛需要持续采样与满足相应条件。
处理前后对比
- 较大 α 更新快但噪声和震荡更强。
- 较大 γ 更重视远期奖励,但误差传播范围更长。
- 使用真实回报与 bootstrap 目标会带来不同偏差—方差权衡。
计算与实现步骤
- 1
先判断训练阶段能否新增环境数据
- 2
选择在线或离线学习路线
- 3
完成最小数值例
- 4
运行教学代码
- 5
比较回报、偏移与失败
- 6
写含数据版本的实验报告
代码实现
示例 1
强化学习算法比较与学习路线的本地数值骨架
example_01.py用途:用确定性数组展示状态、更新和结果,不连接远程环境,也不在网页内执行。
rewards = [0.0, 0.0, 1.0]
gamma = 0.9
G = 0.0
for reward in reversed(rewards):
G = reward + gamma * G
print(round(G, 3))代码解析
解析始终位于完整代码下方,并按实际代码段逐项对应。
输入数据与任务
用确定性数组展示状态、更新和结果,不连接远程环境,也不在网页内执行。
Step 1 · 1–6 行
输出中间参数、形状或最终指标,用于核对代码是否符合预期。
rewards = [0.0, 0.0, 1.0]
gamma = 0.9
G = 0.0
for reward in reversed(rewards):
G = reward + gamma * G
print(round(G, 3))预期输出或运行结果
0.81
常见错误 · 3 条
- 只报告最好的一次随机种子
- 训练回报与评测回报混用
- 终止状态仍错误 bootstrap
实际应用
- 序贯决策
- 控制与资源分配
常见错误
文档来源
强化学习可靠资料扩展资料
外部原始教材或论文- 相关定义、公式与算法章节
扩展内容说明
未找到可直接映射的本地强化学习文档;中文直觉、数值例子、代码和交互演示属于扩展解释,算法定义与公式以所列教材或原论文为依据。
完整比较表
15 种算法的训练属性
“样本效率”是相对、定性的教学标记,不能脱离环境和实现直接排名。
| 算法 | 方法类别 | 策略归属 | 动作空间 | Replay/数据复用 | Target/Reference | Reward Model | Preference Data | 样本效率 | 典型场景 |
|---|---|---|---|---|---|---|---|---|---|
| Q-Learning | Value-based | off-policy | 离散 | 否 | 否 | 否 | 否 | 低/中 | 表格控制 |
| SARSA | Value-based | on-policy | 离散 | 否 | 否 | 否 | 否 | 低/中 | 风险敏感在线控制 |
| DQN | Deep Value | off-policy | 离散 | 是 | 是 | 否 | 否 | 中 | 高维离散控制 |
| REINFORCE | Policy-based | on-policy | 离散/连续 | 否 | 否 | 否 | 否 | 低 | 教学与概率策略 |
| Actor-Critic | Actor-Critic | 常见 on-policy | 离散/连续 | 可选 | 可选 | 否 | 否 | 中 | 低方差策略学习 |
| A2C | Actor-Critic | on-policy | 离散/连续 | 否 | 否 | 否 | 否 | 中 | 同步并行环境 |
| A3C | Actor-Critic | on-policy | 离散/连续 | 否 | 否 | 否 | 否 | 中 | 异步并行环境 |
| DDPG | Actor-Critic | off-policy | 连续 | 是 | 是 | 否 | 否 | 高 | 确定性连续控制 |
| TD3 | Actor-Critic | off-policy | 连续 | 是 | 是 | 否 | 否 | 中/高 | 稳健连续控制 |
| SAC | Actor-Critic | off-policy | 连续 | 是 | 是 | 否 | 否 | 高 | 最大熵连续控制 |
| CQL | Offline conservative Q | 固定离线数据 | 离散/连续 | 静态数据集 | Target network | 否 | 否 | 高(离线) | 数据外价值保守化 |
| IQL | Offline implicit Q | 固定离线数据 | 离散/连续 | 静态数据集 | Target Q / V | 否 | 否 | 高(离线) | 数据动作上的隐式改进 |
| PPO | Actor-Critic | on-policy | 离散/连续 | rollout | 否 | RLHF 可用 | 否 | 中 | 机器人、游戏、RLHF |
| GRPO | Policy optimization | on-policy 组采样 | 文本序列 | 组内 rollout | reference | 规则或模型奖励 | 组奖励 | 中 | 可验证推理任务 |
| DPO | Preference objective | 离线 | 文本序列 | 偏好对 | reference | 无需显式 RM | 是 | 高 | 离线偏好对齐 |
初学者
GridWorld → Q-Learning → SARSA → Bellman/TD
深度强化学习
DQN → Actor-Critic → PPO / SAC
Offline RL
固定数据边界 → 分布偏移 → 行为约束 → CQL / IQL → 离线评测
大模型对齐
Reward/Preference → PPO → GRPO → DPO 对照
实践项目
环境协议 → 基线 → 多 seed → 评测与错误分析
算法属性与数据边界
失败模式、风险与性能
失败模式
- 探索不足
- 目标漂移
- 函数近似不稳定
目标与安全风险
- 奖励函数与真实目标不一致会诱发奖励黑客。
- 部署策略的行动权限必须由环境和应用层约束。
性能与复现
- 样本效率、墙钟时间和显存占用需要分别报告。
- 应使用多个随机种子、置信区间和固定评测策略。
常见问题
强化学习算法比较与学习路线是 on-policy 还是 off-policy?
这是基础或比较概念,具体归属取决于所讨论算法。
网页是否会训练模型?
不会。所有图表使用固定种子或解析公式在浏览器本地计算,不执行页面中的示例代码。
资料来源与核对日期
核对日期:2026-08-30。算法定义与公式依据以下外部教材或原论文;中文直觉、教学代码、对照与部署建议属于本站扩展解释。
推荐学习资料
参考库不会生成虚假资源或无效外部链接。