UltraTex: Unleashing 2K Multi-View Diffusion for 3D Texturing
cs.CV
Submitted: 2026-09-19
Updated: 2026-09-19
Project page: https://yiboz2001.github.io/UltraTex
Terminology
Sources
- LumiTex: Towards High-Fidelity PBR Texture Generation with Illumination Context
- Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers
- Seed3D 1.0: From Images to High-Fidelity Simulation-Ready 3D Assets
- Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material
- Hunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Details
- Step1X-3D: Towards High-Fidelity and Controllable Generation of Textured 3D Assets
- Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation
- Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations
- UniTEX: Universal High Fidelity Generative Texturing for 3D Shapes
- Flow Matching for Generative Modeling
- CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation
- MoBA: Mixture of Block Attention for Long-Context LLMs
- VMoBA: Mixture-of-Block Attention for Video Diffusion Models
- Direct3D-S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention
- SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention
- SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
- VSA: Faster Video Diffusion with Trainable Sparse Attention
- TexVerse: A Universe of 3D Objects with High-Resolution Textures
- Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models