RL · 学习方向
从 MDP、Bellman 与 TD,到 DQN、SAC,再进入 Offline RL 的分布偏移、行为约束、CQL / IQL,最后对照 PPO、GRPO 与 DPO。
分层知识地图
分组来自真实概念数据,收藏、已学习、排序和搜索状态继续生效。
Agent 决策,Environment 执行转移并返回观察、奖励和终止信号。
Python 示例
状态支持决策,动作改变环境,奖励提供局部反馈。
Python 示例
用状态、动作、转移、奖励和折扣统一描述序贯决策。
Python 示例
智能体通过与环境交互,在延迟反馈下学习最大化长期回报的行为。
Python 示例
比较标签、反馈时机、数据分布和优化目标。
Python 示例
策略产生动作分布,Episode 定义一次交互边界,Trajectory 保存完整经历。
Python 示例
回报汇总未来奖励,γ 控制远期反馈的权重。
Python 示例
探索获取未知动作信息,利用选择当前估计最优动作。
Python 示例
给定当前状态后,未来转移不再依赖更早历史。
Python 示例
在小网格中观察状态、动作、障碍、终点和奖励。
Python 示例
用行为数据学习贪心目标策略的动作价值,是经典 off-policy TD 控制。
NumPy 示例
学习 V 或 Q,并由价值比较导出策略。
Python 示例
使用实际下一动作 A′ 的 on-policy TD 控制。
NumPy 示例
用下一状态行为策略下 Q 的期望替代单个采样动作。
Python 示例
用两套估计分离动作选择与动作评价,缓解 max 过估计。
Python 示例
用神经网络近似高维状态的 Q 值,并以 Replay 与 Target Network 稳定训练。
PyTorch 示例
DQN 的两项核心稳定化机制。
Python 示例
Online 选动作,Target 评价该动作,缓解 DQN 过估计。
Python 示例
网络分解状态价值 V 与动作优势 A 后再聚合 Q。
Python 示例
按 TD error 优先采样更有学习价值的 transition,并用重要性权重校正偏差。
Python 示例
组合 Double、Dueling、PER、multi-step、distributional RL 与 noisy nets。
Python 示例
Actor 输出策略,Critic 估计价值并提供低方差学习信号。
Python 示例
同步或异步并行环境收集 Actor-Critic 数据。
Python 示例
用 λ 加权多步 TD residual,在偏差与方差间调节 advantage。
Python 示例
连续动作下的 off-policy 确定性 Actor-Critic。
Python 示例
以双 Critic、延迟 Actor 和目标策略平滑改进 DDPG。
Python 示例
最大熵 off-policy Actor-Critic,在回报与策略熵之间优化。
Python 示例
用概率比率裁剪限制策略单次更新幅度的 on-policy Actor-Critic 方法。
PyTorch 示例
区分奖励建模、反馈来源和强化微调训练循环。
Python 示例
直接用 chosen/rejected 偏好对优化策略相对 reference 的概率差,不运行传统在线 RL 循环。
PyTorch 示例
对同一输入采样一组输出,用组内相对奖励估计 advantage,再进行带裁剪与 KL 的策略优化。
PyTorch 示例
区分在线策略优化、组相对在线优化和离线偏好目标。
Python 示例
分析奖励模型误差、长度偏差、分布外偏好和训练不稳定。
Python 示例
在线 RL 可继续探索环境,离线 RL 只能使用固定数据集。
Python 示例
理解数据占用分布、分布外动作、bootstrap 误差累积以及为什么固定 replay 会让朴素 DQN/SAC 失效。
NumPy 示例
用行为克隆、KL/MMD 距离、生成模型或优势加权回归控制策略偏离数据分布。
NumPy 示例
在 Bellman 误差之外惩罚数据外高 Q,并相对抬高数据动作,学习保守的价值函数。
PyTorch 示例
用上 expectile 价值、只含数据动作的 Q 更新和优势加权行为克隆,避免训练时评价策略生成的未见动作。
PyTorch 示例
观察不足以确定真实状态时,用历史、belief 或记忆决策。
Python 示例
解决奖励少、来得晚以及如何归因到早期动作。
Python 示例
处理多主体相互影响或高层目标—低层技能分解。
Python 示例
从专家行为直接模仿,或反推出潜在奖励。
Python 示例
学习环境动力学并滚动规划未来动作。
Python 示例
在不扭曲目标的前提下改善学习信号,并约束风险和扰动。
Python 示例
用多随机种子、置信区间、独立评测策略和资源指标报告结果。
Python 示例