Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning
cs.LG, cs.AI, cs.CL
Submitted: 2026-04-12
Updated: 2026-09-09
Comments: 20 pages including appendix, 5 figures
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- OpenAI o1 System Card
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Kimi K2: Open Agentic Intelligence
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Proximal Policy Optimization Algorithms
- High-Dimensional Continuous Control Using Generalized Advantage Estimation
- What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret
- VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training
- Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training
- VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks
- Truncated Proximal Policy Optimization
- Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning
- Improve Mathematical Reasoning in Language Models by Automated Process Supervision
- BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning
- Process Reinforcement through Implicit Rewards
- Generative Reward Models
- Inference-Time Scaling for Generalist Reward Modeling
- RM-R1: Reward Modeling as Reasoning
- Process Reward Models That Think
- Qwen3 Technical Report
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks