RAVE: Re-Allocating Visual Attention in Large Multimodal Models
cs.CV
Submitted: 2026-05-18
Updated: 2026-09-18
Terminology
Sources
- GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints
- Qwen3-VL Technical Report
- OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
- Qwen2.5-VL Technical Report
- Mistral 7B
- See What You Are Told: Visual Attention Sink in Large Multimodal Models
- Rethinking Visual Information Processing in Multimodal LLMs
- D-Attn: Decomposed Attention for Large Vision-and-Language Models
- Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning
- Attention Reallocation: Towards Zero-cost and Controllable Hallucination Mitigation of MLLMs
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs
- Look-Back: Implicit Visual Re-focusing in MLLM Reasoning
- MODA: MOdular Duplex Attention for Multimodal Perception, Cognition, and Emotion Understanding
- Attention Debiasing for Token Pruning in Vision Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models