POLICY PLAYBACK
RRL Studio
把原理,变成你的代码。
选择一条学习路径。从一个具体问题出发,读懂推导,调整实验,再亲手实现。
REINFORCEMENT LEARNING
强化学习
从概率与回报开始,走过价值学习、策略梯度,再训练一个能保持平衡的智能体。
13 门课程 · 50 章理论 · 84 道练习进入强化学习 ↗OBJECT DETECTION
视觉检测
从一张图像与几个框开始,理解 YOLO、DETR,以及用语言逐步生成视觉结果的方法。
检测基础 · YOLO · DETR · 自回归视觉进入视觉检测 ↗理论与交互即点即用。代码练习在你的浏览器中执行,学习进度自动保存。
REINFORCEMENT LEARNING
强化学习
从理论到代码,再到亲手训练智能体。
13开放课程
84代码练习
50理论章节
完整学习路径
从基础概念开始,按知识依赖逐步推进