ProCredit: From Outcome Rewards to Progress Credit in Agentic Reinforcement Learning
cs.LG, cs.CL
Submitted: 2026-09-23
Updated: 2026-09-24
Terminology
Sources
- Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
- Reinforcement Learning for Long-Horizon Interactive LLM Agents
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Group-in-Group Policy Optimization for LLM Agent Training
- Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization
- PRInTS: Reward Modeling for Long-Horizon Information Seeking
- SALT: Step-level Advantage Assignment for Long-horizon Agents via Trajectory Graph
- Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
- Agentic Reinforcement Learning with Implicit Step Rewards
- GEM: A Gym for Agentic LLMs
- ToolRL: Reward is All Tool Learning Needs
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Hindsight Credit Assignment for Long-Horizon LLM Agents
- AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents
- Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
- SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution
- A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks