Mira-Scene: Pixel-Aligned Layouts for Generative 3D Scene Reconstruction
cs.CV, cs.GR
Submitted: 2026-09-20
Updated: 2026-09-22
Project page: https://sunyangtian.github.io/Mira-Scene-web
Terminology
Sources
- SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model
- Automated Creation of Digital Cousins for Robust Policy Learning
- Emerging Properties in Unified Multimodal Pretraining
- Boxer: Robust Lifting of Open-World 2D Bounding Boxes to 3D
- ALIVE: Animate Your World with Lifelike Audio-Video Generation
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- Classifier-Free Diffusion Guidance
- LRM: Large Reconstruction Model for Single Image to 3D
- CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling
- MegaPose: 6D Pose Estimation of Novel Objects via Render & Compare
- Hunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Details
- Back to Basics: Let Denoising Generative Models Denoise
- TripoSG: High-Fidelity 3D Shape Synthesis using Large-Scale Rectified Flow Models
- Sparc3D: Sparse Representation and Construction for High-Resolution 3D Shapes Modeling
- Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models
- PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion Transformers
- I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners
- Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation
- Flow Matching for Generative Modeling
- JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models