Emergent Unfaithfulness: How Alignment Training Causes Language Models to Silently Override Task Faithfulness

arXiv:2610.00568 · cs.CL, cs.AI · Submitted 2026-09-30 · Read on arXiv

cs.CL, cs.AI

Submitted: 2026-09-30

Updated: 2026-09-30

Code: https://github.com/uiuc-conversational-ai-lab/Emergent-unfaithfulness

Project page: https://uiuc-conversational-ai-lab.github.io/Emergent-unfaithfulness

Terminology

Sources

Related papers