V-CoLA: Vision Token Compression with Linear Attention
cs.CV, cs.LG
Submitted: 2026-10-08
Updated: 2026-10-08
Terminology
Sources
- Simple linear attention language models balance the recall-throughput tradeoff
- Qwen3-VL Technical Report
- Token Merging: Your ViT But Faster
- AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
- Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
- MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
- Visual-Word Tokenizer: Beyond Fixed Sets of Tokens in Vision Transformers
- LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression
- Repeat After Me: Transformers are Better than State Space Models at Copying
- SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension
- Token Sequence Compression for Efficient Multimodal Computing
- Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression
- OpenAI GPT-5 System Card
- InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models
- Kimi Linear: An Expressive, Efficient Attention Architecture
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
- PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
- Gated Delta Networks: Improving Mamba2 with Delta Rule
- A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models