Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies
cs.RO, cs.CV, cs.LG
Submitted: 2026-09-02
Updated: 2026-09-02
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- RT-1: Robotics Transformer for Real-World Control at Scale
- Vision-Language-Action (VLA) Models: Concepts, Progress, Applications and Challenges
- OpenVLA: An Open-Source Vision-Language-Action Model
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
- TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
- Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization
- Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
- LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
- When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs
- What Makes Training Multi-Modal Classification Networks Hard?
- Balanced Multimodal Learning via On-the-fly Gradient Modulation
- On Uni-Modal Feature Learning in Supervised Multi-Modal Learning
- Deep Multimodal Learning with Missing Modality: A Survey
- Play to the Score: Stage-Guided Dynamic Multi-Sensory Fusion for Robotic Manipulation
- FocusVLA: Focused Visual Utilization for Vision-Language-Action Models
- GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization
- LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies
- Openpi Comet: Competition Solution For 2025 BEHAVIOR Challenge
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving