Data-free On-policy Distillation
cs.LG, cs.AI
Submitted: 2026-09-12
Updated: 2026-09-17
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation
- Rethinking On-Policy Distillation of Large Language Models II: One Training Example
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- JustRL: Scaling a 1.5B LLM with a Simple RL Recipe
- Measuring Mathematical Problem Solving With the MATH Dataset
- On-Policy Delta Distillation
- Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe
- What Matters in On-Policy Distillation? A Perspective on Data Efficiency and Data Selection
- Editing Models with Task Arithmetic
- R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training
- On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents
- LIMR: Less is More for RL Scaling
- UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- A Survey of On-Policy Distillation for Large Language Models
- SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation
- Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation
- LESS: Selecting Influential Data for Targeted Instruction Tuning
- MiMo-V2-Flash Technical Report
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks