Efficient Safety Alignment of Language Models via Latent Personality Traits

arXiv:2607.07918 · cs.LG, cs.AI, cs.CL, cs.CR · Submitted 2026-08-14 · Read on arXiv

Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere, Linh Le, David Williams-King, Adam Oberman

cs.LG, cs.AI, cs.CL, cs.CR

Submitted: 2026-08-14

Updated: 2026-08-18

Comments: 15 pages, 6 figures. Accepted at COLM 2026

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Sources

Related papers