Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents
cs.LG, cs.AI
Submitted: 2026-09-27
Updated: 2026-09-27
Code: https://github.com/mingju-c/Align-OPSD
Terminology
Sources
- Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- Rethinking On-Policy Self-Distillation for Thinking Models
- GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
- What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
- Self-Distilled Agentic Reinforcement Learning
- Privileged Information Distillation for Language Models
- Qwen2.5 Technical Report
- ALFWorld: Aligning Text and Embodied Environments for Interactive Learning
- Hindsight Credit Assignment for Long-Horizon LLM Agents
- MuSiQue: Multihop Questions via Single-hop Question Composition
- Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
- TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
- OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
- Multi-Rollout On-Policy Distillation via Peer Successes and Failures
- Latent On-Policy Self-Distillation
- StepOPSD: Step-Aware Online Preference Self-Distillation for Agent Reinforcement Learning
- Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks