CityToolVQA: Tool-Augmented Visual Question Answering for 3D Spatial Cognition in Urban Low-Altitude Environments
cs.CV
Submitted: 2026-09-26
Updated: 2026-09-26
Terminology
Sources
- Qwen3-VL Technical Report
- S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
- Kimi-VL Technical Report
- MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery
- MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action
- Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models