Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation
cs.RO
Submitted: 2026-07-28
Updated: 2026-09-18
Code: https://github.com/SWE-agent/mini-swe-agent
Terminology
Sources
- NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
- StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
- Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation
- Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System
- Embodied Navigation Foundation Model
- TINA: Think, Interaction, and Action Framework for Zero-Shot Vision Language Navigation
- Zero-Shot Vision-and-Language Navigation with Collision Mitigation in Continuous Environment
- CMMR-VLN: Vision-and-Language Navigation via Continual Multimodal Memory Retrieval
- DV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language Navigation
- Vesta: A Generalist Embodied Reasoning Model
- Automating the Design of Embodied Agent Architectures
- AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness
- NaVILA: Legged Robot Vision-Language-Action Model for Navigation
- Hy-Embodied-VLM-1.0: Efficient Physical-World Agents
- RynnBrain: Open Embodied Foundation Models
- OmniNav: A Unified Framework for Prospective Exploration and Visual-Language Navigation
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving