Many Eyes, One World: Feed-Forward 3D Reconstruction from Mixed Cameras
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- Joint 2D-3D-Semantic Data for Indoor Scene Understanding
- Unified Panoramic Geometry Estimation via Multi-View Foundation Models
- MUSt3R: Multi-view Network for Stereo 3D Reconstruction
- Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses
- UniDAC: Universal Metric Depth Estimation for Any Camera
- Extending Foundational Monocular Depth Estimators to Fisheye Cameras with Calibration Tokens
- PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery
- Depth Any Camera: Zero-Shot Metric Depth Estimation from Any Camera
- CAM3R: Camera-Agnostic Model for 3D Reconstruction
- RIGOR: Rig-Informed Geometry for Omnidirectional Reconstruction
- Pow3R: Empowering Unconstrained 3D Reconstruction with Camera and Scene Priors
- Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning
- MapAnything: Universal Feed-Forward Metric 3D Reconstruction
- CalibAnyView: Beyond Single-View Camera Calibration in the Wild
- Rig3R: Rig-Aware Conditioning for Learned 3D Reconstruction
- Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation
- CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage
- SimpleProc: Fully Procedural Synthetic Data from Simple Rules for Multi-View Stereo
- Holo360D: A Large-Scale Real-World Dataset with Continuous Trajectories for Advancing Panoramic 3D Reconstruction and Beyond
- RayTun3R: Online Camera Adaptation in 3D Foundation Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models