Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
cs.LG, cs.AI
Submitted: 2026-03-26
Updated: 2026-09-02
Code: https://github.com/huggingface/open-r1
Terminology
Sources
- Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning
- Self-Evolving Curriculum for LLM Reasoning
- The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models
- Concise Reasoning via Reinforcement Learning
- The Llama 3 Herd of Models
- Measuring Mathematical Problem Solving With the MATH Dataset
- REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
- MAPO: Mixed Advantage Policy Optimization
- OpenAI o1 System Card
- RePO: Replay-Enhanced Policy Optimization
- LIMR: Less is More for RL Scaling
- No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning
- MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
- Learning Dynamics in RL Post-Training for Language Models
- A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment
- Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks