WALT: Learning World-Model-Aligned Latent Trajectories for Autonomous Driving
cs.RO, cs.CV
Submitted: 2026-09-24
Updated: 2026-09-24
Terminology
Sources
- DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
- MGVQ: Could VQ-VAE Beat VAE? A Generalizable Tokenizer with Multi-group Quantization
- Think Locally, Refine Globally for Memory-Efficient 3D Reconstruction
- Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation
- LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels
- Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
- The Role of World Models in Shaping Autonomous Driving: A Comprehensive Survey
- 3D and 4D World Modeling: A Survey
- Enhancing End-to-End Autonomous Driving with Latent World Model
- ImagiDrive: A Unified Imagination-and-Planning Framework for Autonomous Driving
- WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving
- EponaV2: Driving World Model with Comprehensive Future Reasoning
- Revisiting Feature Prediction for Learning Visual Representations from Video
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement
- DINO-Tok: Adapting DINO for Visual Tokenizers
- Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
- Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
- Autoregressive End-to-End Planning with Time-Invariant Spatial Alignment and Multi-Objective Policy Refinement
- AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving