Query, Align, and Distill: Navigation-Aware Cross-Modal Interaction for Efficient Vision-and-Language Navigation
cs.CV, cs.AI, cs.RO
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- ViLAM: Distilling Vision-Language Reasoning into Attention Maps for Social Robot Navigation
- MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
- FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph
- Improving Cross-Modal Alignment in Vision Language Navigation via Syntactic Information
- Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding
- Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
- Weakly-supervised VLM-guided Partial Contrastive Learning for Visual Language Navigation
- CLEAR: Improving Vision-Language Navigation with Cross-Lingual, Environment-Agnostic Representations
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models