Systematic Multi-Agent Vision-and-Language Navigation: Formulation, Benchmark, and Method
cs.CV, cs.AI, cs.RO
Submitted: 2026-09-28
Updated: 2026-10-07
Project page: https://xyz9911.github.io/mavln
Terminology
Sources
- VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
- Co-NavGPT: Multi-Robot Cooperative Visual Semantic Navigation Using Vision Language Models
- Collaborative Visual Navigation
- DeCoNav: Dialog enhanced Long-Horizon Collaborative Vision-Language Navigation
- Does Peer Observation Help? Vision-Sharing Collaboration for Vision-Language Navigation
- RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration
- Embodied Navigation Foundation Model
- JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
- StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
- CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning
- CAMON: Cooperative Agents for Multi-Object Navigation with LLM-based Conversations
- Hierarchical LLM-Based Multi-Agent Framework with Prompt Optimization for Multi-Robot Task Planning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models