Where Does Exactly-Once Live? Model, Harness, and Tool-Contract Effects on Duplicate Side Effects in LLM Agents
cs.LG, cs.AI, cs.SE
Submitted: 2026-09-24
Updated: 2026-09-24
Code: https://github.com/gssanjana4/idempotencybench
Terminology
Sources
- $\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment
- SagaLLM: Context Management, Validation, and Transaction Guarantees for Multi-Agent LLM Planning
- Cordon: Semantic Transactions for Tool-Using LLM Agents
- AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents
- CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
- ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions
- Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation
- AI Agents That Matter
- WAREX: Web Agent Reliability Evaluation on Existing Benchmarks
- Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures
- AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
- GoEX: Perspectives and Designs Towards a Runtime for Autonomous LLM Applications
- Towards a Science of AI Agent Reliability
- Identifying the Risks of LM Agents with an LM-Emulated Sandbox
- Reflexion: Language Agents with Verbal Reinforcement Learning
- ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems
- AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection
- PALADIN: Self-Correcting Language Model Agents to Cure Tool-Failure Cases
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks