AHEAD: Adaptive Hindsight with Environment-Augmented Distillation for Agentic RL
cs.AI
Submitted: 2026-08-25
Updated: 2026-08-25
Comments: 22 pages, 15 figures, 7 tables
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- Learning by Cheating
- Energy-Based Transfer for Reinforcement Learning
- Agentic Reinforced Policy Optimization
- Group-in-Group Policy Optimization for LLM Agent Training
- Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
- Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- UI-S1: Advancing GUI Automation via Semi-online Reinforcement Learning
- UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning
- Self-Distilled Agentic Reinforcement Learning
- SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
- ECHO: Terminal Agents Learn World Models for Free
- Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
- EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
- SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning
- Qwen2.5 Technical Report
- Qwen3 Technical Report
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection