What Shared Prefixes Hide: Trajectory Dropout for On-Policy Distillation
cs.AI
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- Demystifying Training-Time Augmentation for Data-Constrained Language Model Pretraining
- Trajectory-Refined Distillation
- Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance
- Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation
- ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation
- Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models
- Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation
- Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation
- Qwen3 Technical Report
- On-Policy Context Distillation for Language Models
- Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation
- Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection