Still There, No Longer Seen: Exposing Compression-Induced Risk in Large Vision-Language Models
cs.CV, cs.AI, cs.CR
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- Qwen3-VL Technical Report
- Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference
- Visual Token Compression Enhances Robustness of MLLMs
- Transferable Adversarial Attacks on Black-Box Vision-Language Models
- N\"uwa: Mending the Spatial Integrity Torn by VLM Token Pruning
- Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models
- An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models
- PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention
- Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models
- LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- Rethinking Token Reduction for Large Vision-Language Models
- Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
- PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
- Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models
- VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
- Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models
- Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models
- On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
- SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models