Why Are LLM Backdoor Defenses Fragmented? A Feature-Level Explanation with Sparse Autoencoders

arXiv:2608.30403 · cs.CR · Submitted 2026-08-31 · Read on arXiv

cs.CR

Submitted: 2026-08-31

Updated: 2026-08-31

Terminology

Sources

Related papers