When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
cs.LG
Submitted: 2026-09-17
Updated: 2026-09-17
Comments: 30 pages, 12 figures, 3 tables, code available at https://github.com/UNCSciML/opd-eos
Code: https://github.com/UNCSciML/opd-eos
Project page: https://uncsciml.github.io/opd-eos-website
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
- The Llama 3 Herd of Models
- Entropy-Aware On-Policy Distillation of Language Models
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
- ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation
- Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation
- Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
- Trust-Region Behavior Blending for On-Policy Distillation
- Gemma 3 Technical Report
- Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations
- On the Position Bias of On-Policy Distillation
- Pass the Baton: Trajectory-Relayed On-Policy Distillation
- Qwen3 Technical Report
- Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
- Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
- Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks