Representational alignment yields generalizable safety in language models

arXiv:2609.04022 · cs.CL, cs.AI · Submitted 2026-09-03 · Read on arXiv

cs.CL, cs.AI

Submitted: 2026-09-03

Updated: 2026-09-03

Code: https://github.com/LingyuLi-Cogs/ReSO

Terminology

Sources

Related papers