OneCanvas: 3D Scene Understanding via Panoramic Reprojection
cs.CV, cs.AI, cs.LG, cs.RO
Submitted: 2026-06-17
Updated: 2026-09-27
Project page: https://baranowskibrt.github.io/onecanvas
Terminology
Sources
- Qwen3-VL Technical Report
- SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards
- Thinking with Spatial Code for Physical-World Video Reasoning
- 3D Aware Region Prompted Vision Language Model
- Video-R1: Reinforcing Video Reasoning in MLLMs
- Visuospatial Cognitive Assistant
- LiftProj: Space Lifting and Projection-Based Panorama Stitching
- PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding
- PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning
- When LLMs step into the 3D World: A Survey and Meta-Analysis of 3D Tasks via Multi-modal Large Language Models
- Do 3D Large Language Models Really Understand 3D Spatial Relationships?
- SpaceR: Reinforcing MLLMs in Video Spatial Reasoning
- Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
- Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes
- Visual Spatial Tuning
- SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models
- PANORAMA: The Rise of Omnidirectional Vision in the Embodied AI Era
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models