Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization
cs.AI
Submitted: 2026-08-31
Updated: 2026-09-14
Terminology
Sources
- Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents
- Agentic Reinforced Policy Optimization
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
- Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
- Distilling the Knowledge in a Neural Network
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
- Let's Verify Step by Step
- AgentBench: Evaluating LLMs as Agents
- Self-Distilled Agentic Reinforcement Learning
- CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning
- Toolformer: Language Models Can Teach Themselves to Use Tools
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
- RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- On the Position Bias of On-Policy Distillation
- Trust Region On-Policy Distillation
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection