Unlocking the Critic: Reward-Free Policy Optimization for LLM Post-Training
cs.LG, cs.AI, cs.CL
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/huggingface/open-r1
Terminology
Sources
- Concrete Problems in AI Safety
- Seed1.5-Thinking: Advancing Superb Reasoning Models with Reinforcement Learning
- Training Verifiers to Solve Math Word Problems
- Process Reinforcement through Implicit Rewards
- The Llama 3 Herd of Models
- REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
- Kimi k1.5: Scaling Reinforcement Learning with LLMs
- Kimi K2: Open Agentic Intelligence
- MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
- EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
- Proximal Policy Optimization Algorithms
- Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
- Spurious Rewards: Rethinking Training Signals in RLVR
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
- Solving math word problems with process- and outcome-based feedback
- Qwen3 Technical Report
- What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret
- VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks
- Group Sequence Policy Optimization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks