My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning
cs.CL
Submitted: 2026-10-01
Updated: 2026-10-01
Code: https://github.com/SKYLENAGE-AI/FAULT_Agentic_RL
Terminology
Sources
- The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- ToolRL: Reward is All Tool Learning Needs
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
- Group-in-Group Policy Optimization for LLM Agent Training
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning
- AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
- Process Reward Models for LLM Agents: Practical Framework and Directions
- Retrospective Progress-Aware Self-Refinement for LLM Agent Training
- Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
- Group-Reflective Self-Distillation for Agentic Reinforcement Learning
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning
- Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training
- Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
- Qwen3 Technical Report
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering