HelloWorld: Towards Practical Applications of Generative Driving World Models
cs.CV
Submitted: 2026-09-24
Updated: 2026-09-24
Project page: https://helloworld-4d.github.io
Terminology
Sources
- Wan: Open and Advanced Large-Scale Video Generative Models
- Cosmos World Foundation Model Platform for Physical AI
- Advancing Open-source World Models
- BEVControl: Accurately Controlling Street-view Elements with Multi-perspective Consistency via BEV Sketch Layout
- DriveDreamer: Towards Real-world-driven World Models for Autonomous Driving
- MagicDrive-V2: High-Resolution Long Video Generation for Autonomous Driving with Adaptive Control
- DiVE: DiT-based Video Generation with Enhanced Control
- Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
- GAIA-1: A Generative World Model for Autonomous Driving
- GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving
- DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT
- MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving
- Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
- Infinite Worlds with Versatile Interactions
- VACE: All-in-One Video Creation and Editing
- Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models
- UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving
- Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving
- OmniNWM: Omniscient Driving Navigation World Models
- FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models