Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving
cs.CV, cs.RO
Submitted: 2026-07-31
Updated: 2026-09-16
Code: https://github.com/codingmlinprocess/LCS
Terminology
Sources
- Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
- EMMA: End-to-End Multimodal Model for Autonomous Driving
- MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving
- DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
- NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning
- HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving
- Classifier-Free Diffusion Guidance
- A Language Agent for Autonomous Driving
- VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
- Generative Scenario Rollouts for End-to-End Autonomous Driving
- UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving
- DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving
- OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
- GPT-Driver: Learning to Drive with GPT
- VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness
- Natural Language Instructions for Scene-Responsive Human-in-the-Loop Motion Planning in Autonomous Driving using Vision-Language-Action Models
- Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning
- DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
- Rethinking the Open-Loop Evaluation of End-to-End Autonomous Driving in nuScenes
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models