Skip to content
mlmentorship

Book VII · Chapter 2

Policy optimization

Build policy gradients, actor-critic methods, advantage estimation, and PPO.

Priority
Specialist
Difficulty
Advanced
Useful for
RS, RE, Post-training, Robotics
Interview rounds
Research, Post-training

Read first: RL foundations and value methods

Chapter contents

4 entries · read in order
  1. 01
    Policy gradient methods
    Concept
  2. 02
    Actor-critic methods
    Concept
  3. 03
    Advantage estimation and GAE
    Concept
  4. 04
    Proximal Policy Optimization (PPO)
    Concept