Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching
cs.RO, cs.AI
Submitted: 2026-09-01
Updated: 2026-09-01
Code: https://github.com/naver-ai/DroneCATS
Terminology
Sources
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- Qwen3-VL Technical Report
- Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap
- AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation
- DeTrack: A Benchmark and Altitude-Aware Dual World Model for Drone-embodied Tracking
- Taking Flight with Dialogue: Enabling Natural Language Control for PX4-based Drone Agent
- CognitiveDrone: A VLA Model and Evaluation Benchmark for Real-Time Cognitive Task Solving and Reasoning in UAVs
- Cosmos 3: Omnimodal World Models for Physical AI
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- RALLY: Role-Adaptive LLM-Driven Yoked Navigation for Agentic UAV Swarms
- Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation
- ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue
- UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
- ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception
- OnFly: Onboard Zero-Shot Aerial Vision-Language Navigation toward Safety and Efficiency
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving