Relationally Grounded Latent World Models for Autonomous Driving
cs.CV, cs.RO
Submitted: 2026-09-21
Updated: 2026-09-21
Terminology
Sources
- VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
- LAD-Drive: Bridging Language and Trajectory with Action-Aware Diffusion Transformers
- GAIA-1: A Generative World Model for Autonomous Driving
- Orbis: Overcoming Challenges of Long-Horizon Prediction in Driving World Models
- DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
- DriveFuture: Future-Aware Latent World Models for Autonomous Driving
- Latent Chain-of-Thought World Modeling for End-to-End Driving
- Latent-WAM: Latent World Action Modeling for End-to-End Autonomous Driving
- DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving
- DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving
- LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
- Bridging Structure and Language: Graph-Based Visual Reasoning for Autonomous Road Understanding
- GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving
- GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving
- Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models