Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
Yufei Xia, Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang
cs.CR, cs.AI, cs.IR, cs.LG, cs.MA
Submitted: 2026-07-08
Comments: To appear in COLM 2026
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- GPT-4 Technical Report
- Where Did It All Go Wrong? A Hierarchical Look into Multi-Agent Error Attribution
- Emergent autonomous scientific research capabilities of large language models
- Optimizing Model Selection for Compound AI Systems
- FlowReasoner: Reinforcing Query-Level Meta-Agents
- The Llama 3 Herd of Models
- LLM Multi-Agent Systems: Challenges and Open Problems
- Automated Design of Agentic Systems
- Large Language Models Are State-of-the-Art Evaluators of Translation Quality
- Weak-for-Strong: Training Weak Meta-Agent to Harness Strong Executors
- UTrace: Poisoning Forensics for Private Collaborative Learning
- LLM-as-a-Judge & Reward Model: What They Can and Cannot Do
- Multi-Agent Coordination across Diverse Applications: A Survey
- Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents
- AutoDev: Automated AI-Driven Development
- MasRouter: Learning to Route LLMs for Multi-Agent Systems
- TextGrad: Automatic "Differentiation" via Text
- EvoFlow: Evolving Diverse Agentic Workflows On The Fly
- AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
- WebArena: A Realistic Web Environment for Building Autonomous Agents
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs