VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing
cs.AI
Submitted: 2026-05-28
Updated: 2026-08-30
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- PaliGemma: A versatile 3B VLM for transfer
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- RT-1: Robotics Transformer for Real-World Control at Scale
- From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
- LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models
- Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
- Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust
- Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- Mechanistic interpretability for steering vision-language-action models
- ${\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities
- $\pi^{*}_{0.6}$: a VLA That Learns From Experience
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
- Microsoft COCO: Common Objects in Context
- Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
- Cosmos World Foundation Model Platform for Physical AI
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- FAST: Efficient Action Tokenization for Vision-Language-Action Models
- OpenVLA: An Open-Source Vision-Language-Action Model
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection