Text-Vision Synergistic Token Caching: A Training-Free Framework for Efficient Vision-Language-Action Inference
cs.CV, cs.RO
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- OpenVLA: An Open-Source Vision-Language-Action Model
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
- SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead
- How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf
- DyQ-VLA: Temporal-Dynamic-Aware Quantization for Embodied Vision-Language-Action Models
- QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
- CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding
- DeeAD: Dynamic Early Exit of Vision-Language Action for Efficient Autonomous Driving
- VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
- Llama 2: Open Foundation and Fine-Tuned Chat Models
- Evaluating Real-World Robot Manipulation Policies in Simulation
- SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
- Similarity-Aware Token Pruning: Your VLM but Faster
- Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models