Agentic Relative Camera Pose Estimation via Learned Ranking and Verification
cs.CV
Submitted: 2026-09-30
Updated: 2026-09-30
Terminology
Sources
- ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data
- SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
- AssistGPT: A General Multi-modal Assistant that can Plan, Execute, Inspect, and Learn
- Pursuing Minimal Sufficiency in Spatial Reasoning
- G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
- Multi-view Pyramid Transformer: Look Coarser to See Broader
- DINOv2: Learning Robust Visual Features without Supervision
- Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents
- Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models
- MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action
- Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning
- Stereo Magnification: Learning View Synthesis using Multiplane Images
- 4KAgent: Agentic Any Image to 4K Super-Resolution
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models