Value Mirror Descent for Reinforcement Learning
math.OC, cs.LG, math.PR
Submitted: 2026-04-07
Updated: 2026-09-23
Terminology
Sources
- Stochastic Primal-Dual Methods and Sample Complexity of Reinforcement Learning
- Policy Optimization over General State and Action Spaces
- Strongly-polynomial time and validation analysis of policy gradient methods
- Auto-exploration for online reinforcement learning
- First-order Policy Optimization for Robust Markov Decision Process
- Proximal Policy Optimization Algorithms
- Primal-Dual $\pi$ Learning: Sample Complexity and Sublinear Run Time for Ergodic Markov Decision Problems
Related papers
- Lions and Muons: Optimization via Stochastic Frank-Wolfe under Heavy-Tailed Noise
- Adam-HNAG: A Convergent Reformulation of Adam with Accelerated Rate
- Incremental Learning in Mirror Flows
- Online Control via Counterfactual Tracking
- Asynchronous Replanning in Two Population Linear Quadratic Mean Field Games: Information Requirements and Stability
- Petrov-Galerkin operator inference with application to stability-encouraging identification