UnifiedAttack: Evaluating the Safety of Large Multimodal Models in Synergistic Harmful Image-Text Generation
cs.CR, cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/bingjunluo/UnifiedAttack
Terminology
Sources
- Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
- Emerging Properties in Unified Multimodal Pretraining
- SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
- HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model
- BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- Visual Instruction Tuning
- Chameleon: Mixed-Modal Early-Fusion Foundation Models
- Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
- Emu3: Next-Token Prediction is All You Need
- T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model
Related papers
- SoK: AI-Augmented Binary Reversing
- Relaxed Sender Anonymity for CBDC Interbank Settlement: A Zero-Knowledge Approach on Permissioned EVM
- Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages
- Efficient Fuzzy PSI under One-Sided Assumptions
- Sealing the Audit-Runtime Gap for LLM Skills
- Token Composition: A Graph Based on EVM Logs