A stochastic subgradient method with optimal failure exponent
math.OC, stat.ML
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization
- Large Deviation Upper Bounds and Improved MSE Rates of Nonlinear SGD: Heavy-tailed Noise and Power of Symmetry
- Risk level dependent Minimax Quantile lower bounds for Interactive Statistical Decision Making
- Can SGD Handle Heavy-Tailed Noise?
- Subgradient Methods for Nonsmooth Convex Functions with Adversarial Errors
- Tight Analyses for Non-Smooth Stochastic Gradient Descent
- Making the Last Iterate of SGD Information Theoretically Optimal
- High Probability Convergence of Stochastic Gradient Methods
- High-probability minimax lower bounds
- Stochastic Gradient Descent for Non-smooth Optimization: Convergence Results and Optimal Averaging Schemes
- Negative Stepsizes Make Gradient-Descent-Ascent Converge
Related papers
- Lions and Muons: Optimization via Stochastic Frank-Wolfe under Heavy-Tailed Noise
- Adam-HNAG: A Convergent Reformulation of Adam with Accelerated Rate
- Incremental Learning in Mirror Flows
- Online Control via Counterfactual Tracking
- Asynchronous Replanning in Two Population Linear Quadratic Mean Field Games: Information Requirements and Stability
- Petrov-Galerkin operator inference with application to stability-encouraging identification