POLICY PLAYBACK
RRL Studio
REINFORCEMENT LEARNING
今天想学点什么?
从理论到代码,再到亲手训练智能体。
13开放课程
84代码练习
50理论章节
完整学习路径
从基础概念开始,按知识依赖逐步推进输入邀请码,进入强化学习课程、代码练习与浏览器训练实验。
从理论到代码,再到亲手训练智能体。
写完代码后运行测试,这里会显示结果与错误定位。
使用当前浏览器的 CPU / GPU,运行完整数据链路:采样 → GAE → minibatch → clipped objective → 参数更新。
说明策略存活得更久。CartPole 每坚持一步获得 1 分,最高 500。
表示新旧策略没有突然分离;PPO 的核心正是进行保守而稳定的更新。
表示有多少样本触碰了裁剪边界。长期过高通常意味着学习率或更新轮数偏大。
账号只同步题目状态和课程进度。你的代码、测试输出与训练数据不会上传。
无需邮箱、手机号或验证码。忘记密码暂时无法找回,请妥善保存。
学习进度已在此设备与账户之间合并。代码和训练数据仍只保存在本机。