ConvCue: Complementary Visual Inductive Biases for Vision-Language Models
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/LanLanLan-Ian/CONVCUE
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Emerging Properties in Self-Supervised Vision Transformers
- MiMo-VL Technical Report
- Scalable Vision Language Model Training via High Quality Data Curation
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
- Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
- Gemma 3 Technical Report
- Kimi-VL Technical Report
- Role of Locality and Weight Sharing in Image-Based Tasks: A Sample Complexity Separation between CNNs, LCNs, and FCNs
- Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
- LLaVA-OneVision: Easy Visual Task Transfer
- SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension
- Ovis: Structural Embedding Alignment for Multimodal Large Language Model
- Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
- Do Vision Transformers See Like Convolutional Neural Networks?
- When Do We Not Need Larger Vision Models?
- LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
- Gemini Robotics: Bringing AI into the Physical World
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models