Importance-Aware OBS Pruning for Diffusion Models
cs.CV
Submitted: 2026-07-22
Updated: 2026-09-28
Code: https://github.com/hpcaitech/Open-Sora
Terminology
Sources
- Classifier-Free Diffusion Guidance
- Hunyuan-DiT: A Powerful Multi-Resolution Diffusion Transformer with Fine-Grained Chinese Understanding
- Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
- SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- Denoising Diffusion Implicit Models
- Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
- GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models
- SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
- eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers
- Make-A-Video: Text-to-Video Generation without Text-Video Data
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
- DreamFusion: Text-to-3D using 2D Diffusion
- Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model
- 3DDesigner: Towards Photorealistic 3D Object Generation and Editing with Text-guided Diffusion Models
- Point-E: A System for Generating 3D Point Clouds from Complex Prompts
- DiffWave: A Versatile Diffusion Model for Audio Synthesis
- Wuerstchen: An Efficient Architecture for Large-Scale Text-to-Image Diffusion Models
- MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models