CoVLM-Bench: A Real-World Benchmark for Cooperative Driving Question Answering and Planning
cs.CV
Submitted: 2026-09-22
Updated: 2026-09-22
Code: https://github.com/sidiangongyuan/CoVLM-Bench
Project page: https://sidiangongyuan.github.io/CoVLM-Bench/ABSTRACT
Terminology
Sources
- Qwen3-VL Technical Report
- What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models
- CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models
- V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models
- MDrive: Benchmarking Closed-Loop Cooperative Driving for End-to-End Multi-agent Systems
- Mid-Band 5G: A Measurement Study in Europe and US
- Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning
- nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving
- EMMA: End-to-End Multimodal Model for Autonomous Driving
- Bench2Drive-VL: Benchmarks for Closed-Loop Autonomous Driving with Vision-Language Models
- Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
- AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning
- Measuring Faithfulness in Chain-of-Thought Reasoning
- ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving
- RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving
- AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning
- DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
- Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
- An Extensible Framework for Open Heterogeneous Collaborative Perception
- LingoQA: Visual Question Answering for Autonomous Driving
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models