PAIQ: Patch-Aligned Semantic Injection via Residual Rotation
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-30
Terminology
Sources
- CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models
- DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment
- BRAVE: Broadening the visual encoding of vision-language models
- SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension
- Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM
- DINOv2: Learning Robust Visual Features without Supervision
- Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders
- Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
- SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
- Sigmoid Loss for Language Image Pre-Training
- LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models