Understanding Off- vs On-Policy Distillation: A Tale of Distinct Training Objectives
cs.LG, cs.AI, stat.ML
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- Eluder dimension: localise it!
- Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
- Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
- Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification
- Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe
- Reinforcement Learning via Self-Distillation
- On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization
- Near-Optimal Regret for KL-Regularized Multi-Armed Bandits
- RL Fine-Tuning Heals OOD Forgetting in SFT
- Entropy-Aware On-Policy Distillation of Language Models
- DistiLLM-2: A Contrastive Approach Boosts the Distillation of LLMs
- DistiLLM: Towards Streamlined Distillation for Large Language Models
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
- Self-Distilled Policy Gradient
- Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context
- Achieving Logarithmic Regret in KL-Regularized Zero-Sum Markov Games
- KL for a KL: On-Policy Distillation with Control Variate Baseline
- Self-Distillation Enables Continual Learning
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks