Revision, Not Restart: Revisable Visual Plans for Closed-Loop World-Action Models
cs.RO, cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Project page: https://placeholder.github.io/RTP
Terminology
Sources
- Feedback World Model Enables Precise Guidance of Diffusion Policy
- Motus: A Unified Latent Action World Model
- AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
- Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
- LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- RMBench: Memory-Dependent Robotic Manipulation Benchmark with Insights into Policy Design
- FlowWAM: Optical Flow as a Unified Action Representation for World Action Models
- Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies
- SAM2Act: Integrating Visual Foundation Model with A Memory Architecture for Robotic Manipulation
- Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
- Chameleon: Control-Indexed Prospective Memory for Visuomotor Manipulation
- Streaming Diffusion Policy: Fast Policy Synthesis with Variable Noise Diffusion Models
- FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking
- OpenVLA: An Open-Source Vision-Language-Action Model
- Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction
- Causal World Modeling for Robot Control
- OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs
- Light-WAM: Efficient World Action Models with State-Fusion Action Decoding
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving