REACT: Rolling Denoising and Dual Decoupling for Reactive Robot Control with VLA Models
cs.RO, cs.AI
Submitted: 2026-10-08
Updated: 2026-10-08
Terminology
Sources
- RT-1: Robotics Transformer for Real-World Control at Scale
- OpenVLA: An Open-Source Vision-Language-Action Model
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Training-Time Action Conditioning for Efficient Real-Time Chunking
- Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
- Running VLAs at Real-time Speed
- FASTER: Rethinking Real-Time Flow VLAs
- One ACT Play: Single Demonstration Behavior Cloning with Action Chunking Transformers
- Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots
- Flow Matching for Generative Modeling
- Latent Theory of Mind: A Decentralized Diffusion Architecture for Cooperative Manipulation
- NaVILA: Legged Robot Vision-Language-Action Model for Navigation
- 3D-VLA: A 3D Vision-Language-Action Generative World Model
- FALCON: Actively Decoupled Visuomotor Policies for Loco-Manipulation with Foundation-Model-Based Coordination
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot
- Gemini Robotics: Bringing AI into the Physical World
- FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving