ForeFly: A Dual-Horizon World Action Model for Aerial Vision-Language Navigation
cs.CV
Submitted: 2026-09-27
Updated: 2026-09-27
Code: https://github.com/kunhuiW/ForeFly
Terminology
Sources
- Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments
- WorldVLA: Towards Autoregressive Action World Model
- Large Video Planner Enables Generalizable Robot Control
- Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap
- Diffusion Models for Smarter UAVs: Decision-Making and Modeling
- Aerial Vision-and-Dialog Navigation
- DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
- LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration
- SpatialFly: Implicit 3D Prior-Guided Visual Reparameterization for Continuous UAV Vision-and-Language Navigation
- RAVEN: Resilient Aerial Navigation via Open-Set Semantic Memory and Behavior Adaptation
- OpenVLN: Open-world Aerial Vision-Language Navigation
- VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method
- AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild
- Aerial Vision-Language Navigation with a Unified Framework for Spatial, Temporal and Embodied Reasoning
- World Action Models are Zero-shot Policies
- NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
- FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation
- Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation
- MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving
- WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models