SparkDiffusion: Mitigating the High-Sparsity Trap --- A Unified Framework for up to 265 times Single-GPU Acceleration of Visual Generation
cs.CV
Submitted: 2026-09-19
Updated: 2026-10-08
Code: https://github.com/AlibabaResearch/SparkDiffusion
Project page: https://sparkdiffusion.github.io
Terminology
Sources
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation
- SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Flow Matching for Generative Modeling
- Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers
- CrossDistill: Balancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation
- RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers
- Parallel Decoding Distillation for Fast Image and Video Generation
- Consistency Models
- Wan: Open and Advanced Large-Scale Video Generative Models
- VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking
- Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
- SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference
- TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times
- SLA2: Sparse-Linear Attention with Learnable Routing and QAT
- Fast Video Generation with Sliding Tile Attention
- RoLA: Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models