Learning diverse attacks on large language models for robust red-teaming and safety tuning

arXiv:2405.18540 · cs.CL, cs.CR, cs.LG · Submitted 2024-05-28 · Read on arXiv

cs.CL, cs.CR, cs.LG

Submitted: 2024-05-28

Updated: 2026-08-31

Code: https://github.com/GFNOrg/red-teaming

Terminology

Sources

Related papers