NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation
cs.CV, cs.AI, cs.RO
Submitted: 2026-06-02
Updated: 2026-09-23
Code: https://github.com/ModelTC/lightx2v
Terminology
Sources
- Cosmos World Foundation Model Platform for Physical AI
- Qwen Technical Report
- ArtiFixer: Enhancing and Extending 3D Reconstruction with Auto-Regressive Diffusion Models
- Flex Attention: A Programming Model for Generating Optimized Attention Kernels
- GAIA-1: A Generative World Model for Autonomous Driving
- Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
- BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers
- Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
- LATR: 3D Lane Detection from Monocular Images with Transformer
- World Simulation with Video Foundation Models for Physical AI
- Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
- Movie Gen: A Cast of Media Foundation Models
- Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models
- GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving
- Advancing Open-source World Models
- Wan: Open and Advanced Large-Scale Video Generative Models
- ChronoEdit: Towards Temporal Reasoning for Image Editing and World Simulation
- DriveArena: A Closed-loop Generative Simulation Platform for Autonomous Driving
- World Action Models are Zero-shot Policies
- Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models