Truthful AI Advisors: A Pre-Specified Benchmark for Large Language Model Honesty Under Preference Misalignment

arXiv:2606.01456 · cs.LG, cs.CL, cs.GT · Submitted 2026-05-31 · Read on arXiv

cs.LG, cs.CL, cs.GT

Submitted: 2026-05-31

Updated: 2026-08-30

Code: https://github.com/iHamidHasani/cheap-talk-llm-benchmark

Terminology

Sources

Related papers