Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate

arXiv:2609.01168 · cs.AI, cs.MM · Submitted 2026-09-01 · Read on arXiv

cs.AI, cs.MM

Submitted: 2026-09-01

Updated: 2026-09-02

Code: https://github.com/rrgeorge-pdcontributions/NSFW-Words-List

Terminology

Sources

Related papers