DivOPD: Spread Wide, Look Close for Asynchronous On-Policy Distillation of Multi-turn Agents
cs.LG, cs.AI, cs.CL
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/HanyangWang0418-oss/DivOPD
Terminology
Sources
- On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation
- $\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control
- Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning
- AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
- Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous RL
- Distilling the Knowledge in a Neural Network
- DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training
- AsyncOPD: How Stale Can On-Policy Distillation Be?
- Kimi K3: Open Frontier Intelligence
- DistiLLM: Towards Streamlined Distillation for Large Language Models
- On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents
- Online Batch Selection for Faster Training of Neural Networks
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing
- Prioritized Experience Replay
- ALFWorld: Aligning Text and Embodied Environments for Interactive Learning
- BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents
- TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks