Who Teaches Which Token? Verifier-Gated Multi-Expert On-Policy Distillation for Scientific Reasoning
cs.AI
Submitted: 2026-09-14
Updated: 2026-09-15
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- Reward-Gated On-Policy Distillation
- Rubrics as Privileged Information for Open-Ended Generation
- Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation
- Improving Data and Reward Design for Scientific Reasoning in Large Language Models
- MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning
- Rubric-based On-policy Distillation
- Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation
- EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
- Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
- Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance
- CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation
- ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
- Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold
- A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation
- When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation
- Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models
- Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation
- DAPD: Dual-Anchored Policy Distillation
- CriPO: Enhancing Rubric-based RL via Self-Distillation
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection