Diagnosing the Sources of Compositional Failure in Vision-Language Models: A Controlled Analysis
cs.CV
Submitted: 2026-09-25
Updated: 2026-09-25
Terminology
Sources
- Vision-Language Models Do Not Understand Negation
- Dense and Aligned Captions (DAC) Promote Compositional Reasoning in VL Models
- Teaching Structured Vision&Language Concepts to Vision&Language Models
- Probing Image-Language Transformers for Verb Understanding
- Compositionality decomposed: how do neural networks generalise?
- ComCLIP: Training-Free Compositional Image and Text Matching
- CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning
- The Hard Positive Truth about Vision-Language Compositionality
- Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations
- Grounded Language-Image Pre-training
- Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
- CREPE: Can Vision-Language Foundation Models Reason Compositionally?
- Kosmos-2: Grounding Multimodal Large Language Models to the World
- Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks
- SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
- A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks
- Contrasting Intra-Modal and Ranking Cross-Modal Hard Negatives to Enhance Visio-Linguistic Compositional Understanding
- A Contrastive Compositional Benchmark for Text-to-Image Synthesis: A Study with Unified Text-to-Image Fidelity Metrics
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models