ORCA: Hunting Compositional Failures in Text-to-Image Diffusion
cs.CV, cs.LG
Submitted: 2026-10-07
Updated: 2026-10-07
Terminology
Sources
- CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
- Infinity and Beyond: Compositional Alignment in VAR and Diffusion T2I Models
- Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings
- DINOv2: Learning Robust Visual Features without Supervision
- Flow Matching for Generative Modeling
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models