FailBench: How Reliable are VLMs at Judging Robot Task Success?

arXiv:2609.03611 · cs.RO, cs.AI · Submitted 2026-09-03 · Read on arXiv

cs.RO, cs.AI

Submitted: 2026-09-03

Updated: 2026-09-03

Project page: https://metric-ai-lab.github.io/failbench

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Sources

Related papers