Slot3R: Set-Associative Spatial Memory for Streaming 3D Reconstruction
cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Project page: https://ashleyxyz.github.io/Slot-3R/Abstract
Terminology
Sources
- Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass
- $\pi^3$: Permutation-Equivariant Visual Geometry Learning
- 3D Reconstruction with Spatial Memory
- Point3R: Streaming 3D Reconstruction with Explicit Spatial Pointer Memory
- Continuous 3D Perception Model with Persistent State
- Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction
- InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams
- Attention Itself Could Retrieve.RetrieveVGGT: Training-Free Long Context Streaming 3D Reconstruction via Query-Key Similarity Retrieval
- HD-VGGT: High-Resolution Visual Geometry Transformer
- VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences
- Diversity-aware View Partitioning for Scalable VGGT
- FastVGGT: Training-Free Acceleration of Visual Geometry Transformer
- Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction
- ZipMap: Linear-Time Stateful 3D Reconstruction via Test-Time Training
- Efficiently Reconstructing Dynamic Scenes One D4RT at a Time
- SM4RT: Learning Structured Motion Geometry for 4D Reconstruction
- TTT3R: 3D Reconstruction as Test-Time Training
- MeMix: Writing Less, Remembering More for Streaming 3D Reconstruction
- FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction
- Mamba-VGGT: Persistent Long-Sequence Video Geometry Grounded Transformer via External Sliding Window Mamba Memory
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models