Region-Aware CLS Token Augmentation for Fine-Grained Image Retrieval
cs.CV, cs.LG
Submitted: 2026-10-07
Updated: 2026-10-07
Terminology
Sources
- Multi-Token Enhancing for Vision Representation Learning
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- DINOv2: Learning Robust Visual Features without Supervision
- On the Theoretical Limitations of Embedding-Based Retrieval
- Large-Scale Image Retrieval with Attentive Deep Local Features
- Unifying Deep Local and Global Features for Image Search
- Emerging Properties in Self-Supervised Vision Transformers
- detrex: Benchmarking Detection Transformers
- DINOv3
- Microsoft COCO: Common Objects in Context
- MUVERA: Multi-Vector Retrieval via Fixed Dimensional Encodings
- Boosting vision transformers for image retrieval
- Global-Local Similarity for Efficient Fine-Grained Image Recognition with Vision Transformers
- A Study on Token Pruning for ColBERT
- SOAR: Improved Indexing for Approximate Nearest Neighbor Search
- DynamicViT: Efficient Vision Transformers with Dynamic Token Sparsification
- TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?
- ProxyNCA++: Revisiting and Revitalizing Proxy Neighborhood Component Analysis
- Classification is a Strong Baseline for Deep Metric Learning
- Attention-based Ensemble for Deep Metric Learning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models