Less Language, More Latents: Annotation-Efficient VLAs for Driving
cs.RO, cs.LG
Submitted: 2026-09-23
Updated: 2026-09-23
Terminology
Sources
- TransFuser: Imitation with Transformer-Based Sensor Fusion for Autonomous Driving
- Safety-Enhanced Autonomous Driving Using Interpretable Sensor Fusion Transformer
- Trajectory-guided Control Prediction for End-to-end Autonomous Driving: A Simple yet Strong Baseline
- Planning-oriented Autonomous Driving
- VAD: Vectorized Scene Representation for Efficient Autonomous Driving
- Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving
- SimLingo: Vision-Only Closed-Loop Autonomous Driving with Language-Action Alignment
- ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
- OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning
- Imitating Latent Policies from Observation
- Learning to Act without Actions
- Genie: Generative Interactive Environments
- Think2Drive: Efficient Reinforcement Learning by Thinking in Latent World Model for Quasi-Realistic Autonomous Driving (in CARLA-v2)
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- OpenVLA: An Open-Source Vision-Language-Action Model
- Octo: An Open-Source Generalist Robot Policy
- GPT-Driver: Learning to Drive with GPT
- ADriver-I: A General World Model for Autonomous Driving
- DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
- DriveGPT4: Interpretable End-to-end Autonomous Driving via Large Language Model
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving