LongRCA Bench: Root-Cause Localization in Long-Horizon Agent Trajectories
cs.AI, cs.SE
Submitted: 2026-08-15
Updated: 2026-09-21
Comments: 34 pages, 11 figures. Yunfei Zhang and Boyu Feng contributed equally. Changhua Pei is the corresponding author
Project page: https://longrca-bench.github.io
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Where Did It All Go Wrong? A Hierarchical Look into Multi-Agent Error Attribution
- AgentRx: Diagnosing AI Agent Failures from Execution Trajectories
- Why Do Multi-Agent LLM Systems Fail?
- SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
- TRAIL: Trace Reasoning and Agentic Issue Localization
- Who is Introducing the Failure? Automatically Attributing Failures of Multi-Agent Systems via Spectrum Analysis
- VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
- Rethinking Failure Attribution in Multi-Agent Systems: A Multi-Perspective Benchmark and Evaluation
- Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?
- Automatic Failure Attribution and Critical Step Prediction Method for Multi-Agent Systems Based on Causal Inference
- FALAT: Tracing Failures in LLM Agent Trajectories via Dependency-Guided Search
- TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems
- The Long-Horizon Task Mirage? Diagnosing Where and Why Agentic Systems Break
- From Flat Logs to Causal Graphs: Hierarchical Failure Attribution for LLM-based Multi-Agent Systems
- CORRECT: COndensed eRror RECognition via knowledge Transfer in multi-agent systems
- Failure as a Process: An Anatomy of CLI Coding Agent Trajectories
- SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection