On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents
cs.LG, cs.AI
Submitted: 2026-06-14
Updated: 2026-09-23
Terminology
Sources
- Reinforcement Learning for Long-Horizon Interactive LLM Agents
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
- The False Promise of Imitating Proprietary LLMs
- Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe
- Entropy-Aware On-Policy Distillation of Language Models
- Distilling LLM Agent into Small Models with Retrieval and Code Tools
- Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
- Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
- ALFWorld: Aligning Text and Embodied Environments for Interactive Learning
- Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
- Structured Agent Distillation for Large Language Model
- A Survey of On-Policy Distillation for Large Language Models
- SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation
- Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models
- Qwen3 Technical Report
- Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models
- Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
- TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks