SuperNav: An Agentic Navigation System for Any Task in Any Scene
cs.RO, cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Project page: https://zju3dv.github.io/SuperNav/1
Terminology
Sources
- ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects
- HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness
- Show-Harness: Just a VLM Agent Can Play Robots
- Inner Monologue: Embodied Reasoning through Planning with Language Models
- AI2-THOR: An Interactive 3D Environment for Visual AI
- AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness
- Flow Matching for Generative Modeling
- InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
- DINOv2: Learning Robust Visual Features without Supervision
- Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI
- AstraNav-Memory: Contexts Compression for Long Memory
- StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
- VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
- SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation
- OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation
- Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks
- NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving