DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation
cs.LG
Submitted: 2026-09-27
Updated: 2026-09-27
Code: https://github.com/YongYuanDeAo/DuoOPD
Terminology
Sources
- Program Synthesis with Large Language Models
- H$^2$SD: Hybrid Hindsight Self-Distillation
- SciKnowEval: Evaluating Multi-level Scientific Knowledge of Large Language Models
- Edu-Theater: A Data-Efficient Agent Framework for Scalable Learner Behavior Simulation through Staging Roll-Call
- The Llama 3 Herd of Models
- Rethinking On-Policy Self-Distillation for Thinking Models
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
- Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation
- On-policy Distillation with Verifiable Reward
- Improving Multi-Task Deep Neural Networks via Knowledge Distillation for Natural Language Understanding
- Unifying distillation and privileged information
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context
- SPOT: Sparse Probing and Outcome Calibration for On-Policy Distillation
- Qwen3 Technical Report
- Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
- On-Policy Context Distillation for Language Models
- Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
- Instruction-Following Evaluation for Large Language Models
- The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks