Are Vision-Language-Action Models Robust to One-Step Observation Perturbations?
cs.AI, cs.LG, cs.RO
Submitted: 2026-09-26
Updated: 2026-09-26
Code: https://github.com/huggingface/lerobot
Terminology
Sources
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Mixture of Horizons in Action Chunking
- Adversarial Attacks on Robotic Vision Language Action Models
- CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
- Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms
- VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
- FAST: Efficient Action Tokenization for Vision-Language-Action Models
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies
- When to Trust Imagination: Adaptive Action Execution for World Action Models
- STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations
- Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models
- RobustVLA: Robustness-Aware Reinforcement Post-Training for Vision-Language-Action Models
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection