When Guardrails Look Effective: Construct Validity Failures in LLM Agent Commerce Evaluation

arXiv:2609.01519 · cs.AI · Submitted 2026-09-01 · Read on arXiv

cs.AI

Submitted: 2026-09-01

Updated: 2026-09-01

Comments: Submitted to the NeurIPS 2026 Trust-AI-Eval Workshop. 7 pages, 2 figures, 3 tables. The accompanying artifact is available at https://anonymous.4open.science/r/a2a-evaluation-artifact-staging-2F25/

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Sources

Related papers