CoDrive: Cross-Vehicle World-Consistent Video Generation with Precise Trajectory Control for Cooperative Driving
cs.CV, cs.AI
Submitted: 2026-09-28
Updated: 2026-09-28
Project page: https://codrive-project-page.github.io
Terminology
Sources
- BoT-SORT: Robust Associations Multi-Pedestrian Tracking
- UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
- Video Depth Anything: Consistent Depth Estimation for Super-Long Videos
- Matrix-game 2.0: An open-source, real-time, and streaming interactive world model
- GAIA-1: A Generative World Model for Autonomous Driving
- Multiplayer Interactive World Models with Representation Autoencoders
- MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data
- DiVE: DiT-based Video Generation with Enhanced Control
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- OmniNWM: Omniscient Driving Navigation World Models
- DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model
- Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
- Yume-1.5: A Text-Controlled Interactive World Generation Model
- Cosmos 3: Omnimodal World Models for Physical AI
- UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler
- ActionParty: Multi-Subject Action Binding in Generative Video Games
- Solaris: Building a Multiplayer Video World Model in Minecraft
- Prisma-World: Camera-Controllable Multi-Agent Video World Model
- V2VCrafter: Consistent Street-View Image Generation Across Vehicles
- Wan: Open and Advanced Large-Scale Video Generative Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models