Convergence of Practical Muon
cs.LG, math.OC
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- Scale Weight Decay and Train Better
- Muon with Nesterov Momentum: Heavy-Tailed Noise and (Randomized) Inexact Polar Decomposition
- On MUON optimization: From non-convergence to an error analysis with Polar Express and the Newton-Schulz polynomial from implementations
- Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
- Accelerating Newton-Schulz Iteration for Orthogonalization via Chebyshev-type Polynomials
- GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
- AMUSE: Anytime Muon with Stable Gradient Evaluation
- PolarGrad: A Class of Matrix-Gradient Optimizers from a Unifying Preconditioning Perspective
- Muon is Scalable for LLM Training
- Preconditioning Benefits of Spectral Orthogonalization in Muon
- Phases of Muon: When Muon Eclipses SignSGD
- Convergence Analysis of Muon-type Methods with Inexact LMO in the Degenerate Case
- Convergence Bound and Critical Batch Size of Muon Optimizer
- Practical Efficiency of Muon for Pretraining
- Isotropic Curvature Model for Understanding Deep Learning Optimization: Is Gradient Orthogonalization Optimal?
- Kimi K2: Open Agentic Intelligence
- Kimi K2.5: Visual Agentic Intelligence
- Why Muon Outperforms Adam: A Curvature Perspective
- DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
- Qwen3 Technical Report
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks