PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference
cs.CV, cs.AI
Submitted: 2026-08-27
Updated: 2026-09-21
Code: https://github.com/jjL357/PACE
Terminology
Sources
- Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
- GPT-4 Technical Report
- DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
- Accelerating Vision Transformers with Adaptive Patch Sizes
- ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
- Seed1.5-VL Technical Report
- Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
- AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition
- LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
- Gemini: A Family of Highly Capable Multimodal Models
- HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
- TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization
- PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding
- SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models