Vision-Language-Action Autonomous Driving Agent with Language-based Memory
cs.CV, cs.RO
Submitted: 2026-09-29
Updated: 2026-09-29
Project page: https://kaiyan289.github.io/projects/ad-memo/ABSTRACT
Terminology
Sources
- Qwen3-VL Technical Report
- Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation
- MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving
- Think as Needed: Geometry-Driven Adaptive Perception for Autonomous Driving
- Occluded nuScenes: A Multi-Sensor Dataset for Evaluating Perception Robustness in Automated Driving
- VLN-AVP: Zero-Shot Vision-Language Navigation with Hybrid Long-Short-Term Memory for Autonomous Valet Parking
- UniDriveVLA: Unifying Understanding, Perception, and Action Planning for Autonomous Driving
- Understanding Time Variations of DNN Inference in Autonomous Driving
- Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving
- OpenAI GPT-5 System Card
- MEM: Multi-Scale Embodied Memory for Vision Language Action Models
- Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail
- LiloDriver: A Lifelong Learning Framework for Closed-loop Motion Planning in Long-tail Autonomous Driving Scenarios
- WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving
- PRAM-R: A Perception-Reasoning-Action-Memory Framework with LLM-Guided Modality Routing for Adaptive Autonomous Driving
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models