Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes
cs.CV, cs.MM
Submitted: 2026-09-22
Updated: 2026-09-22
Terminology
Sources
- Qwen2.5-VL Technical Report
- DepthLM: Metric Depth From Vision Language Models
- Holistic Evaluation of Multimodal LLMs on Spatial Intelligence
- RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation
- Reasoning in Space via Grounding in the World
- 3D Aware Region Prompted Vision Language Model
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
- BLINK: Multimodal Large Language Models Can See but Not Perceive
- Gemini Robotics: Bringing AI into the Physical World
- 3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
- Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning
- OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
- SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
- LLaVA-OneVision: Easy Visual Task Transfer
- PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
- Improved Visual-Spatial Reasoning via R1-Zero-Like Training
- SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
- SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models