Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling
cs.CL, cs.AI
Submitted: 2026-09-01
Updated: 2026-09-24
Code: https://github.com/fbj2333/tool-calling-calibration
Terminology
Sources
- AgentRx: Diagnosing AI Agent Failures from Execution Trajectories
- $\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment
- ToolExpander: Extending the Frontiers of Tool-Using Reinforcement Learning to Weak LLMs
- Beyond Task Completion: Revealing Corrupt Success in LLM Agents through Procedure-Aware Evaluation
- Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents
- The Llama 3 Herd of Models
- Auditing Automated Evaluation, Error Propagation, and Runtime Mitigation in Tool-Using Language Agents
- ToolCritic: Detecting and Correcting Tool-Use Errors in Dialogue Systems
- Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks
- Improve Mathematical Reasoning in Language Models by Automated Process Supervision
- Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
- Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents
- Qwen3 Technical Report
- $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
- Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning
- RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
- Where LLM Agents Fail and How They can Learn From Failures
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering