Fisher-Rao Gradient Flows of Linear Programs and State-Action Natural Policy Gradients
math.OC, cs.LG, cs.NA, cs.SY, eess.SY, math.NA, stat.ML
Submitted: 2024-03-28
Updated: 2026-09-10
Comments: 25 pages, 4 figures, to appear at SIAM Journal on Optimization
Journal ref: SIAM Journal on Optimization, Vol. 35, Iss. 2 (2025), 10.1137/24M1653422
DOI: 10.1137/24M1653422
Code: https://github.com/muellerjohannes/fisher-rao-GFs-LPs
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- GPT-4 Technical Report
- Linear Convergence for Natural Policy Gradient with Log-linear Policy Parametrization
- Dota 2 with Large Scale Deep Reinforcement Learning
- A Geometric Embedding Approach to Multiple Games and Multiple Populations
- Convergence and sample complexity of natural policy gradient primal-dual methods for constrained MDPs
- Actor-critic is implicitly biased towards high entropy optimal policies
- A Fisher-Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces
- Optimal Rates of Convergence for Entropy Regularization in Discounted Markov Decision Processes
- A unified view of entropy-regularized Markov decision processes
- Proximal Policy Optimization Algorithms
Related papers
- Lions and Muons: Optimization via Stochastic Frank-Wolfe under Heavy-Tailed Noise
- Adam-HNAG: A Convergent Reformulation of Adam with Accelerated Rate
- Incremental Learning in Mirror Flows
- Online Control via Counterfactual Tracking
- Asynchronous Replanning in Two Population Linear Quadratic Mean Field Games: Information Requirements and Stability
- Petrov-Galerkin operator inference with application to stability-encouraging identification