Book VII
Reinforcement learning and robotics
Sequential decisions, value and policy methods, environments, rewards, and robotics policy learning.
3 chapters · 13 entriesChapters
3RL foundations and value methods
Start with MDPs, then learn value-based control, exploration, and reward design.
Policy optimization
Build policy gradients, actor-critic methods, advantage estimation, and PPO.
Environments, multiple agents, and robotics
Design environments and reason about interacting agents and learned policies in the physical world.