OuroWorld: Bringing Any 3D World Alive as Diverse, Endlessly Looping 3D Cinemagraphs
cs.CV, cs.GR
Submitted: 2026-10-08
Updated: 2026-10-08
Project page: https://ouroworld.userwei.com
Terminology
Sources
- Demystifying MMD GANs
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- AdaGaR: Adaptive Gabor Representation for Dynamic Scene Reconstruction
- Pantheon360: Taming Digital Twin Generation via 3D-Aware 360{\deg} Video Diffusion
- AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation
- LucidDreamer: Domain-free Generation of 3D Gaussian Splatting Scenes
- Animating Landscape: Self-Supervised Learning of Decoupled Motion and Appearance for Single-Image Video Synthesis
- World Reconstruction From Inconsistent Views
- ViPE: Video Pose Engine for 3D Geometric Perception
- HY-World 2.0: A Multi-Modal World Model for Reconstructing, Generating, and Simulating 3D Worlds
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- WildGaussians: 3D Gaussian Splatting in the Wild
- VividDream: Generating 3D Scene with Ambient Dynamics
- Depth Anything 3: Recovering the Visual Space from Any Views
- Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion
- DreamLoop: Controllable Cinemagraph Generation from a Single Photograph
- SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
- Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models
- HyperNeRF: A Higher-Dimensional Representation for Topologically Varying Neural Radiance Fields
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models