Structured 3D Latents Are Surprisingly Powerful: Unleashing Generalizable Style with 2D Diffusion
cs.CV
Submitted: 2026-05-06
Updated: 2026-09-23
Terminology
Sources
- Denoising Diffusion Implicit Models
- Advances in 3D Generation: A Survey
- DreamFusion: Text-to-3D using 2D Diffusion
- UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation
- Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation
- MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphing
- Score-Based Generative Modeling through Stochastic Differential Equations
- SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
- Flow Matching for Generative Modeling
- Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
- DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation
- Instant3D: Fast Text-to-3D with Sparse-View Generation and Large Reconstruction Model
- MVDream: Multi-view Diffusion for 3D Generation
- LRM: Large Reconstruction Model for Single Image to 3D
- IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models
- An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion
- StyleSplat: 3D Object Style Transfer with Gaussian Splatting
- Fix False Transparency by Noise Guided Splatting
- Object-Centric 2D Gaussian Splatting: Background Removal and Occlusion-Aware Pruning for Compact Object Models
- InstantStyle-Plus: Style Transfer with Content-Preserving in Text-to-Image Generation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models