Seeing Is Not Addressing: Auditing Linguistic Access to Frozen Visual Geometry
cs.CV, cs.LG
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models
- Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP
- Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models
- Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval
- Interpreting the linear structure of vision-language model embedding spaces
- EVA-CLIP: Improved Training Techniques for CLIP at Scale
- SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
- FG-CLIP: Fine-Grained Visual and Textual Alignment
- ABE-CLIP: Training-Free Attribute Binding Enhancement for Compositional Image-Text Matching
- Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling
- VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models