Residual Advantage: Student-Relative Teacher Guidance for RL with Verifiable Rewards
cs.CL
Submitted: 2026-10-08
Updated: 2026-10-08
Terminology
Sources
- Process Reinforcement through Implicit Rewards
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
- Learning from Language Feedback via Variational Policy Distillation
- On-policy Distillation with Verifiable Reward
- Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning
- From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
- Qwen3 Technical Report
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering