Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks

arXiv:2606.07970 · cs.CL, cs.AI · Submitted 2026-06-06 · Read on arXiv

cs.CL, cs.AI

Submitted: 2026-06-06

Updated: 2026-09-27

Code: https://github.com/haomingwen/patcher

Terminology

Sources

Related papers