Scaling Versatile 3D Assets Editing with a Million-Scale Dataset
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/chaofengc/IQA-PyTorch
Terminology
Sources
- Cosmos 3: Omnimodal World Models for Physical AI
- Qwen3-VL Technical Report
- HunyuanImage 3.0 Technical Report
- FullPart: Generating each 3D Part at Full Resolution
- Hunyuan3D 2.1: From Images to High-Fidelity 3D Assets with Production-Ready PBR Material
- MUSIQ: Multi-scale Image Quality Transformer
- Auto-Encoding Variational Bayes
- SegviGen: Repurposing 3D Generative Model for Part Segmentation
- Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing
- TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization
- Feedforward 3D Editing via Text-Steerable Image-to-3D
- Point-E: A System for Generating 3D Point Clouds from Complex Prompts
- GSEdit: Efficient Text-Guided Editing of 3D Objects via Gaussian Splatting
- EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection
- SAM 2: Segment Anything in Images and Videos
- Semantic Image Inversion and Editing using Rectified Stochastic Differential Equations
- DINOv3
- EVA-CLIP: Improved Training Techniques for CLIP at Scale
- Feedforward 3D Editing Learns from Semantic-Part Transformation
- Towards Scalable and Consistent 3D Editing
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models