RL Foundations
MDPs, value functions, TD learning, policy gradients, actor-critic, TRPO and PPO.
—
0 known
0 to review
Loading deck…
Space to flipSpace flip · ← → move · K known · R review · S shuffle
MDPs, value functions, TD learning, policy gradients, actor-critic, TRPO and PPO.
Loading deck…
Space to flipSpace flip · ← → move · K known · R review · S shuffle