SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning
cs.CV, cs.AI
Submitted: 2026-09-27
Updated: 2026-09-27
Project page: https://yangcaoai.github.io/SpatialSpeak
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- InstantSplat: Sparse-view Gaussian Splatting in Seconds
- Map2Thought: Explicit 3D Spatial Reasoning via Metric Cognitive Maps
- Gemini: A Family of Highly Capable Multimodal Models
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
- SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
- OpenAI GPT-5 System Card
- Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
- UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding
- Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass
- Visual Spatial Tuning
- Visibility-aware Multi-view Stereo Network
- Long Context Transfer from Language to Vision
- LLaVA-Video: Video Instruction Tuning With Synthetic Data
- PartLLM: A Unified Multimodal Foundation for 3D Part Segmentation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models