Policy Optimization Achieves Data-Dependent Regret Bounds in MDPs with Unknown Transitions

arXiv:2606.31769 · cs.LG, stat.ML · Submitted 2026-06-30 · Read on arXiv

Mingyi Li, Taira Tsuchiya, Kenji Yamanishi

cs.LG, stat.ML

Submitted: 2026-06-30

Comments: 70 pages, 2 tables

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Sources

Related papers