CtrlWAM: Controllable World Action Models with Aligned Intent and Foresight
cs.CV
Submitted: 2026-10-01
Updated: 2026-10-01
Code: https://github.com/NVlabs/alpasim
Project page: https://ctrl-wam.github.io
Terminology
Sources
- Cosmos 3: Omnimodal World Models for Physical AI
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising
- GAIA-1: A Generative World Model for Autonomous Driving
- Unified Video Action Model
- Flow Matching for Generative Modeling
- Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
- Beyond FVD: Enhanced Evaluation Metrics for Video Generation Quality
- Wan: Open and Advanced Large-Scale Video Generative Models
- World Action Models are Zero-shot Policies
- Fast-WAM: Do World Action Models Need Test-time Future Imagination?
- EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models
- Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models