SPIDER: Multi-Layer Semantic Token Pruning and Adaptive Sub-Layer Skipping in Multimodal Large Language Models
cs.CV, cs.AI
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- Qwen2.5-VL Technical Report
- Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
- Learning to Skip the Middle Layers of Transformers
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models
- EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding
- MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis
- LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer
- Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
- Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding
- LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
- PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
- [CLS] Token Tells Everything Needed for Training-free Efficient MLLMs
- HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
- ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
- Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
- Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models
- LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
- MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
- Evaluating Object Hallucination in Large Vision-Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models