Scene-Q: Confidence-Aware Coarse-to-Fine Querying of 3D Scenes with Selective VLM Reasoning
cs.CV, cs.RO
Submitted: 2026-07-28
Updated: 2026-07-28
Terminology
Sources
- OpenMask3D: Open-Vocabulary 3D Instance Segmentation
- EVA-CLIP: Improved Training Techniques for CLIP at Scale
- CoCa: Contrastive Captioners are Image-Text Foundation Models
- SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
- Qwen2.5-VL Technical Report
- SAM3D: Segment Anything in 3D Scenes
- Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
- High-Quality Entity Segmentation
- OPT: Open Pre-trained Transformer Language Models
- LLaMA: Open and Efficient Foundation Language Models
- Qwen Technical Report
- Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks
- BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models