When Do Models Admit They Are Wrong? Failure Disclosure Is Unstable Under Reinforcement Learning

arXiv:2609.33220 · cs.LG, cs.AI, cs.CL · Submitted 2026-09-27 · Read on arXiv

cs.LG, cs.AI, cs.CL

Submitted: 2026-09-27

Updated: 2026-09-27

Code: https://github.com/safety-research/failure-disclosure

Terminology

Sources

Related papers