WorldLine: Action-Driven Visual Simulation for Robotic Manipulation
cs.RO, cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/dexmal/opendw
Terminology
Sources
- Cosmos 3: Omnimodal World Models for Physical AI
- Masked Visual Actions for Unified World Modeling
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- Qwen3-VL Technical Report
- AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems
- RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
- Galaxea Open-World Dataset and G0 Dual-System VLA Model
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation
- Wan: Open and Advanced Large-Scale Video Generative Models
- RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation
- RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation
- A Pragmatic VLA Foundation Model
- iMaC: Translating Actions into Motion and Contact Images for Embodied World Models
- World Action Models are Zero-shot Policies
- PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation
- Action Images: End-to-End Policy Learning via Multiview Video Generation
- IRASim: A Fine-Grained World Model for Robot Manipulation
- Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving