When Clipping Reverses Correction: Failure Dynamics of Pointwise Forward-KL On-Policy Self-Distillation
cs.CL
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/huggingface/math-verify
Terminology
Sources
- SCOPE-OPSD: Fisher-Conditioned Privileged Subspaces for On-Policy Self-Distillation
- DualOPSD: Adaptive Privileged Teachers for On-Policy Self-Distillation
- PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation
- Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation
- DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
- Reinforcement Learning via Self-Distillation
- Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation
- On-Policy Self-Distillation without Any Supervision
- Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning
- When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
- RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation
- HybridFlow: A Flexible and Efficient RLHF Framework
- PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners
- Self-Supervised On-Policy Distillation for Reasoning Language Models
- TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
- Qwen3 Technical Report
- OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
- What Does Privileged Information Add to On-Policy Self-Distillation?
- Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering