EVO-WAM: Evolving World Action Models through Video-Action Verification
cs.CV, cs.RO
Submitted: 2026-09-29
Updated: 2026-09-29
Project page: https://evo-wam.github.io
Terminology
Sources
- Motus: A Unified Latent Action World Model
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- AdaWorld: Learning Adaptable World Models with Latent Actions
- GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation
- World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays
- Ctrl-World: A Controllable Generative World Model for Robot Manipulation
- VLAW: Iterative Co-Improvement of Vision-Language-Action Policy and World Model
- RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence
- Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models
- Galaxea Open-World Dataset and G0 Dual-System VLA Model
- DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
- Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
- RoboCurate: Harnessing Diversity with Action-Verified Neural Trajectory for Robot Learning
- Learning to Act from Actionless Videos through Dense Correspondences
- Causal World Modeling for Robot Control
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models