Book VII · Chapter 2
Policy optimization
Build policy gradients, actor-critic methods, advantage estimation, and PPO.
Read first: RL foundations and value methods
Book VII · Chapter 2
Build policy gradients, actor-critic methods, advantage estimation, and PPO.
Read first: RL foundations and value methods