Advanced Policies: A First-Principles Path from Policy Gradient to Q-Learning

arXiv:2005.08844 · cs.LG, stat.ML · Submitted 2020-05-18 · Read on arXiv

cs.LG, stat.ML

Submitted: 2020-05-18

Updated: 2026-09-27

Code: https://github.com/hill-a/stable-baselines

Terminology

Sources

Related papers