AD-E2E-JEPA: A Joint-Embedding Predictive Architecture For End-to-End Autonomous Driving
cs.RO, cs.AI, cs.CV, cs.LG
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/HaoranZhuExplorer/AD-E2E-JEPA
Terminology
Sources
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics
- VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning
- Revisiting Feature Prediction for Learning Visual Representations from Video
- End to End Learning for Self-Driving Cars
- Pseudo-Simulation for Autonomous Driving
- VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
- A-JEPA: Joint-Embedding Predictive Architecture Can Listen
- Intuitive physics understanding emerges from self-supervised pretraining on natural videos
- World Models
- GAIA-1: A Generative World Model for Autonomous Driving
- How Far is Video Generation from World Model: A Physical Law Perspective
- Rectified LpJEPA: Joint-Embedding Predictive Architectures with Sparse and Maximum-Entropy Representations
- LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics
- Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation
- Navigation-Guided Sparse Scene Representation for End-to-End Autonomous Driving
- Enhancing End-to-End Autonomous Driving with Latent World Model
- Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
- LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving