RLVR landscapes for iterated multiplications can be benign: Insights from spin-glass theory
cs.LG, cond-mat.dis-nn, stat.ML
Submitted: 2026-09-23
Updated: 2026-09-23
Terminology
Sources
- On the Theory of Policy Gradient Methods: Optimality, Approximation, and Distribution Shift
- Global Optimality Guarantees For Policy Gradient Methods
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients
- Non-Uniform Noise-to-Signal Ratio in the REINFORCE Policy-Gradient Estimator
- VCRL: Variance-based Curriculum Reinforcement Learning for Large Language Models
- Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
- Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review
- Sequential Group Composition: A Window into the Mechanics of Deep Learning
- The Quantization Model of Neural Scaling
- The Primacy Bias in Deep Reinforcement Learning
- Hybrid Reinforcement: When Reward Is Sparse, It's Better to Be Dense
- Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
- RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
- PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks