From Reasoning Failures to Composable Video Spatial Intelligence
cs.CV
Submitted: 2026-10-01
Updated: 2026-10-01
Terminology
Sources
- Qwen3-VL Technical Report
- Scaling Spatial Intelligence with Multimodal Foundation Models
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
- SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL
- EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
- S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence
- BLINK: Multimodal Large Language Models Can See but Not Perceive
- Map2Thought: Explicit 3D Spatial Reasoning via Metric Cognitive Maps
- Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps
- FARM: Find Anything using Relational Spatial Memory
- Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
- 3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
- ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
- See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
- VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
- STI-Bench: Are MLLMs Ready for Precise Spatial-Temporal World Understanding?
- From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- Improved Visual-Spatial Reasoning via R1-Zero-Like Training
- MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models