CitySTAR: Structured and Topology-Aware Reasoning for Open-Vocabulary Urban 3D Grounding
cs.CV
Submitted: 2026-09-17
Updated: 2026-09-17
Terminology
Sources
- Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
- 3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding
- Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
- Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following
- 3EED: Ground Everything Everywhere in 3D
- CityRefer: Geography-aware 3D Visual Grounding Dataset on City-scale Point Cloud Data
- Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models