UAVs Meet Embodied Intelligence: Bridging Human Intents and Flying Dynamics Via Harnessing Physical-Digital AI Agents
cs.RO
Submitted: 2026-09-16
Updated: 2026-09-16
Terminology
Sources
- MorphQuad: Morphable Quadrotor for Superhuman Maneuverability, Manipulation, and Resiliency
- Flying Hand: End-Effector-Centric Framework for Versatile Aerial Manipulation Teleoperation and Policy Learning
- $\pi$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation
- Reinforcement Learning for Active Perception in Autonomous Navigation
- Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method
- SAP-Nav: Spatial Semantic Representation Meets Active Perception for Hierarchical Open-Vocabulary Object Navigation
- ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering
- DeTrack: A Benchmark and Altitude-Aware Dual World Model for Drone-embodied Tracking
- USS: Unifying Spatial-Semantic Prompting for End to End Embodied Visual Tracking
- TrackVLA: Embodied Visual Tracking in the Wild
- TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
- ReferTrack: Referring Then Tracking for Embodied Visual Tracking
- CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models
- UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models
- CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking
- Hierarchical Instruction-aware Embodied Visual Tracking
- Instance-level Visual Active Tracking with Occlusion-Aware Planning
- CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization
- ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception
- ESARBench: A Benchmark for Agentic UAV Embodied Search and Rescue
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving