What Confidence Routing Is Actually Doing: Auditing Routing, Calibration, and Commitment in Multi-Agent Deliberation
cs.MA, cs.CL
Submitted: 2026-08-18
Updated: 2026-08-18
Terminology
Sources
- Why Do Multi-Agent LLM Systems Fail?
- Improving Factuality and Reasoning in Language Models through Multiagent Debate
- Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models
- Verbalized Confidence Triggers Self-Verification: Emergent Behavior Without Explicit Reasoning Supervision
- Language Models (Mostly) Know What They Know
- DeliberationBench: When Do More Voices Hurt? A Controlled Study of Multi-LLM Deliberation Protocols
- LAB-Bench: Measuring Capabilities of Language Models for Biology Research
- Data Cards: Purposeful and Transparent Dataset Documentation for Responsible AI
- ADVICE: Answer-Dependent Verbalized Confidence Estimation
- Should we be going MAD? A Look at Multi-Agent Debate Strategies for LLMs
- Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
- Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets
- Mixture-of-Agents Enhances Large Language Model Capabilities
- Can LLM Agents Really Debate? A Controlled Study of Multi-Agent Debate in Logical Reasoning
- Stop Overvaluing Multi-Agent Debate -- We Must Rethink Evaluation and Embrace Model Heterogeneity
Related papers
- Highway Congestion Reduction through Reinforcement Learning Based Eulerian Headway Control
- You Only Align Once: Propagating Cooperative Behaviors in Multi-Agent Systems through Seed Agents
- Deny Without Disabling: Authorization-Paired Evaluation and Control for Multi-Agent Systems
- MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization
- PeroMAS: A Multi-agent System of Perovskite Material Discovery
- StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning