规划中
价值估计 · 01
TD Learning
从 Monte Carlo 走向 bootstrap,理解预测、控制与时序差分。
选择一个算法,沿着理论、代码与实验逐步掌握。当前开放 PPO,其余内容将依次加入。
从 Monte Carlo 走向 bootstrap,理解预测、控制与时序差分。
将 Q-learning 与神经网络结合,掌握 replay buffer 与 target network。
直接优化期望回报,理解 REINFORCE、采样估计与方差问题。
让 Actor 学习策略、Critic 估计价值,连接策略梯度与 PPO。
写完代码后运行测试,这里会显示结果与错误定位。
使用当前浏览器的 CPU / GPU,运行完整数据链路:采样 → GAE → minibatch → clipped objective → 参数更新。
说明策略存活得更久。CartPole 每坚持一步获得 1 分,最高 500。
表示新旧策略没有突然分离;PPO 的核心正是进行保守而稳定的更新。
表示有多少样本触碰了裁剪边界。长期过高通常意味着学习率或更新轮数偏大。
账号只同步题目状态和课程进度。你的代码、测试输出与训练数据不会上传。
无需邮箱、手机号或验证码。忘记密码暂时无法找回,请妥善保存。
学习进度已在此设备与账户之间合并。代码和训练数据仍只保存在本机。