Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving
cs.CV, cs.AI, cs.LG
Submitted: 2026-08-31
Updated: 2026-08-31
Terminology
Sources
- CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning
- Pseudo-Simulation for Autonomous Driving
- Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
- EMMA: End-to-End Multimodal Model for Autonomous Driving
- AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
- EvaDrive: Evolutionary Adversarial Policy Optimization for End-to-End Autonomous Driving
- Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation
- DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving
- ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
- Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation
- AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
- AWAC: Accelerating Online Reinforcement Learning with Offline Datasets
- Plan-R1: Safe and Feasible Trajectory Planning as Language Modeling
- HMAD: Advancing E2E Driving with Anchored Offset Proposals and Simulation-Supervised Multi-target Scoring
- Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving
- HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving
- OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
- InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
- DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models