NavHarness: Adaptive Goals for Agentic Vision-Language Navigation
cs.CV, cs.RO
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/YanyuanQiao/Open-Nav
Project page: https://navharness.github.io
Terminology
Sources
- ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents
- ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
- Vesta: A Generalist Embodied Reasoning Model
- History Aware Multimodal Transformer for Vision-and-Language Navigation
- HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
- AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
- A Recurrent Vision-and-Language BERT for Navigation
- AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness
- Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions
- Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System
- Scaling Data Generation in Vision-and-Language Navigation
- Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation
- OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation
- ReAct: Synergizing Reasoning and Acting in Language Models
- JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation
- Embodied Navigation Foundation Model
- Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models