OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs
cs.CV
Submitted: 2026-06-21
Updated: 2026-09-26
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Large Language Model-assisted Autonomous Vehicle Recovery from Immobilization
- Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views
- ORION: A Holistic End-to-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving
- 3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding
- GPT-4o System Card
- EMMA: End-to-End Multimodal Model for Autonomous Driving
- Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
- LLaVA-OneVision: Easy Visual Task Transfer
- SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving
- End-to-End Driving with Online Trajectory Evaluation via BEV World Model
- X-Driver: Explainable Autonomous Driving with Vision-Language Models
- LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving
- One Million Scenes for Autonomous Driving: ONCE Dataset
- HiP-AD: Hierarchical and Multi-Granularity Planning with Deformable Attention for Autonomous Driving in a Single Decoder
- Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
- Gemma: Open Models Based on Gemini Research and Technology
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models