Learning to Solve Stochastic Controls with Unknown Drifts and Running Rewards: Theory, Algorithms and Convergence
cs.LG, cs.NA, math.NA, math.OC
Submitted: 2026-09-14
Updated: 2026-09-14
Code: https://github.com/GaozhanWang/MWZZ-RL-2026
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Policy Gradient for Continuous-Time Mean-Field Control
- A Two-fold Randomization Framework for Impulse Control Problems
- Deterministic Policy Gradient for Reinforcement Learning with Continuous Time and State
- Exploratory Optimal Stopping: A Singular Control Formulation
- Deterministic Policy Gradient for Learning Equilibrium in Time-Inconsistent Control Problems
- Conditional Diffusion Guidance under Hard Constraint: A Stochastic Analysis Approach
- Mean--Variance Portfolio Selection by Continuous-Time Reinforcement Learning: Algorithms, Regret Analysis, and Empirical Study
- Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems
- Policy Iteration Achieves Regularized Equilibrium under Time Inconsistency
- A Zeroth-Order Deep Learning Method for Fully Nonlinear Parabolic Partial Differential Equations with Unknown Coefficients
- Discretization error from regularized Reinforcement Learning to continuous-time stochastic control
- Regret of exploratory policy improvement and q-learning
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks