ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving
cs.CV
Submitted: 2026-04-03
Updated: 2026-06-29
Project page: https://zihaosheng.github.io/ExploreVLA
Terminology
Sources
- Pseudo-Simulation for Autonomous Driving
- Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
- A Survey of World Models for Autonomous Driving
- GAIA-1: A Generative World Model for Autonomous Driving
- EMMA: End-to-End Multimodal Model for Autonomous Driving
- DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving
- OmniNWM: Omniscient Driving Navigation World Models
- Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation
- DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
- ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
- Textbooks Are All You Need II: phi-1.5 technical report
- Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
- UniWorld: Autonomous Driving Pre-training via World Models
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Centaur: Robust End-to-End Autonomous Driving with Test-Time Training
- Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
- Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
- UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving
- AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
- ReSim: Reliable World Simulation for Autonomous Driving
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models