Catch Me If You Can: Real-Time Feedback Denoising for Responsive VLAs
cs.RO
Submitted: 2026-09-17
Updated: 2026-09-17
Project page: https://vla-feedback.github.io
Terminology
Sources
- How Fast Can I Run My VLA? Demystifying VLA Inference Performance with VLA-Perf
- Understanding Asynchronous Inference Methods for Vision-Language-Action Models
- Adaptive Action Chunking at Inference-time for Vision-Language-Action Models
- FASTER: Rethinking Real-Time Flow VLAs
- Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning
- A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM
- Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation
- VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference
- Classifier-Free Diffusion Guidance
- Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation
- Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
- AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models
- DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Hume: Introducing System-2 Thinking in Visual-Language-Action Model
- Leave No Observation Behind: Real-time Correction for VLA Action Chunks
- Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models
- robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving