Multi-step Proximal Policy Improvement in Offline Reinforcement Learning
cs.LG
Submitted: 2026-09-03
Updated: 2026-09-03
Terminology
Sources
- Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions
- Optimal transport natural gradient for statistical manifolds with continuous sample space
- FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning
- Uncertainty-Based Offline Reinforcement Learning with Diversified Q-Ensemble
- Sinkhorn Distances: Lightspeed Computation of Optimal Transportation Distances
- Forward-backward Gaussian variational inference via JKO in the Bures-Wasserstein Space
- Off-Policy Deep Reinforcement Learning without Exploration
- A Brief Introduction to Manifold Optimization
- Offline Reinforcement Learning with Implicit Q-Learning
- Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction
- Conservative Q-Learning for Offline Reinforcement Learning
- PPO in the Fisher-Rao geometry
- Q-learning with Adjoint Matching
- Efficient Wasserstein Natural Gradients for Reinforcement Learning
- AWAC: Accelerating Online Reinforcement Learning with Offline Datasets
- Flow Q-Learning
- Revisiting the Minimalist Approach to Offline Reinforcement Learning
- Trust Region Policy Optimization with Optimal Transport Discrepancies: Duality and Algorithm for Continuous Actions
- Behavior Regularized Offline Reinforcement Learning
- Policy Optimization as Wasserstein Gradient Flows
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks