StageCraft: Execution Aware Mitigation of Distractor and Obstruction Failures in VLA Models
cs.RO
Submitted: 2026-03-21
Updated: 2026-09-24
Project page: https://stagecraftdecorator.github.io/stagecraft
Terminology
Sources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation
- Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
- From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models
- Factorizing Diffusion Policies for Observation Modality Prioritization
- Steering Your Diffusion Policy with Latent Space Reinforcement Learning
- You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector
- Task Success is not Enough: Investigating the Use of Video-Language Models as Behavior Critics for Catching Undesirable Agent Behaviors
- Vision-Language Models as Success Detectors
- AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation
- Robotic Control via Embodied Chain-of-Thought Reasoning
- ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models
- Relational Learning for Skill Preconditions
- Prepare Before You Act: Learning From Humans to Rearrange Initial States
- SAM 3: Segment Anything with Concepts
- LeRobot: An Open-Source Library for End-to-End Robot Learning
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving