RRL Studio
浏览器学习空间
REINFORCEMENT LEARNING

算法题库

选择一个算法,沿着理论、代码与实验逐步掌握。当前开放 PPO,其余内容将依次加入。

0已通过练习
1开放算法
1当前轮次
01

算法路径

按知识依赖排列
δ规划中
价值估计 · 01

TD Learning

从 Monte Carlo 走向 bootstrap,理解预测、控制与时序差分。

Q规划中
价值方法 · 02

Deep Q-Network

将 Q-learning 与神经网络结合,掌握 replay buffer 与 target network。

规划中
策略方法 · 03

Policy Gradient

直接优化期望回报,理解 REINFORCE、采样估计与方差问题。

A⁄C规划中
策略方法 · 04

Actor–Critic

让 Actor 学习策略、Critic 估计价值,连接策略梯度与 PPO。