Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing
Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang
cs.CV, cs.CL, cs.CR
Submitted: 2026-07-18
Comments: 14 pages, preprint
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
- Emerging Properties in Unified Multimodal Pretraining
- SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- Explaining and Harnessing Adversarial Examples
- CLIPScore: A Reference-free Evaluation Metric for Image Captioning
- GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium
- Denoising Diffusion Probabilistic Models
- HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
- Progressive Growing of GANs for Improved Quality, Stability, and Variation
- Auto-Encoding Variational Bayes
- G squared TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
- ChemVLM: Exploring the Power of Multimodal Large Language Models in Chemistry Area
- Mist: Towards Improved Adversarial Examples for Diffusion Models
- Visual Instruction Tuning
- I2EBench: A Comprehensive Benchmark for Instruction-based Image Editing
- VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models
- Raising the Cost of Malicious AI-Powered Image Editing
- Intriguing properties of neural networks
- InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models