DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
cs.AI, cs.LG, cs.SE
Submitted: 2026-09-03
Updated: 2026-09-03
Code: https://github.com/IBM/draco
Terminology
Sources
- Reinforcement Learning for Long-Horizon Interactive LLM Agents
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Group-in-Group Policy Optimization for LLM Agent Training
- EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
- SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models
- RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
- Qwen2.5 Technical Report
- Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models Across Agreement, Consistency, and Bias
- YaRN: Efficient Context Window Extension of Large Language Models
- Online Rubrics Elicitation from Pairwise Comparisons
- ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents
- Discretizing Reward Models
- The Verification Horizon: No Silver Bullet for Coding Agent Rewards
- SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
- Spurious Rewards: Rethinking Training Signals in RLVR
- Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- OpenClaw-RL: Train Any Agent Simply by Talking
- Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks
- Learning CLI Agents with Structured Action Credit under Selective Observation
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection