Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models
cs.CV, cs.RO
Submitted: 2026-08-21
Updated: 2026-09-21
Terminology
Sources
- PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling
- Token Merging: Your ViT But Faster
- SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
- DMOFC: Discrimination Metric-Optimized Feature Compression
- Embodied Image Compression
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- Octo: An Open-Source Generalist Robot Policy
- SP-VLA: A Joint Model Scheduling and Token Pruning Approach for VLA Model Acceleration
- SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning
- The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
- Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
- Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
- SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models
- Just Noticeable Difference for Large Multimodal Models
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models