LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
cs.RO, cs.AI
Submitted: 2026-08-31
Updated: 2026-09-09
Project page: https://internrobotics.github.io/internvla-n1.github.io
Terminology
Sources
- 1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)
- On Evaluation of Embodied Navigation Agents
- Qwen3-VL Technical Report
- ObjectNav Revisited: On Evaluation of Embodied Agents Navigating to Objects
- $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control
- Robostral Navigate
- Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity
- Affordances-Oriented Planning using Foundation Models for Continuous Vision-Language Navigation
- $\pi_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
- VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning
- PointArena: Probing Multimodal Grounding Through Language-Guided Pointing
- ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
- Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
- EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
- MolmoAct2: Action Reasoning Models for Real-world Deployment
- Video-R1: Reinforcing Video Reasoning in MLLMs
- OctoNav: Towards Generalist Embodied Navigation
- Gemini Robotics: Bringing AI into the Physical World
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving