Robotic Video World Models: A Survey of Applications, Research Challenges, Future Directions
eess.SY, cs.RO, cs.SY
Submitted: 2026-01-12
Updated: 2026-09-17
Code: https://github.com/irom-princeton/awesome-robotics-video-world-model-papers
Terminology
Sources
- Flow Matching for Generative Modeling
- DiffuEraser: A Diffusion Model for Video Inpainting
- Wan: Open and Advanced Large-Scale Video Generative Models
- Cosmos World Foundation Model Platform for Physical AI
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models
- NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos
- Video Language Planning
- FLIP: Flow-Centric Generative Planning as General-Purpose Manipulation World Model
- WorldGym: World Model as An Environment for Policy Evaluation
- Ctrl-World: A Controllable Generative World Model for Robot Manipulation
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- Gemini Robotics: Bringing AI into the Physical World
- Vid2World: Crafting Video Diffusion Models to Interactive World Models
- EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation
- Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation
- Evaluating Gemini Robotics Policies in a Veo World Simulator
- Training Agents Inside of Scalable World Models
- World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
- Learning to Act from Actionless Videos through Dense Correspondences
- Visual Foresight: Model-Based Deep Reinforcement Learning for Vision-Based Robotic Control
Related papers
- One Request, Multiple Experts: LLM Orchestrates Domain Specific Models via Adaptive Task Routing
- A Geometric Decision Procedure for STL Feasibility and Repair
- Submodular Multi-Agent Policy Learning for Online Distributed Task Allocation in Open Multi-Agent Systems
- Policy-Level Recursive Self-Improvement for Embodied AI with a Criticality World Model
- Minimal Experiments for Robust Stabilization: Information, Spectral Geometry, and Duration
- Decentralized Power-Optimal Coordination for Spacecraft Swarms Using Time-Varying Magnetorquer Actuation