Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate
cs.AI, cs.MM
Submitted: 2026-09-01
Updated: 2026-09-02
Code: https://github.com/rrgeorge-pdcontributions/NSFW-Words-List
Terminology
Sources
- SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
- Improving Image Captioning with Better Use of Captions
- DreamStyler: Paint by Style Inversion with Text-to-Image Diffusion Models
- Controllable Generation with Text-to-Image Diffusion Models: A Survey
- Red-Teaming the Stable Diffusion Safety Filter
- Harnessing LLM to Attack LLM-Guarded Text-to-Image Models
- Safe Latent Diffusion: Mitigating Inappropriate Degeneration in Diffusion Models
- Learning Transferable Visual Models From Natural Language Supervision
- CLIPScore: A Reference-free Evaluation Metric for Image Captioning
- Perception-guided Jailbreak against Text-to-Image Models
- Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models
- Dynamic Optimization and Safety Indicator Injection for Jailbreaking Text-to-Image Models with Multimodal Safety Filters
- Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
- MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models
- Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive Tasks
- Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
- Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
- AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
- Proximal Policy Optimization Algorithms
- DeepSeek-V3 Technical Report
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection