One Threshold Is Not Enough: Prompt-Invariant Caching Schedules for Video Diffusion
cs.CV
Submitted: 2026-07-14
Updated: 2026-09-26
Code: https://github.com/black-forest-labs/flux
Terminology
Sources
- SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
- AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
- SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models
- Sparse VideoGen: Accelerating Video Diffusion Transformers with Spatial-Temporal Sparsity
- Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
- VideoLCM: Video Latent Consistency Model
- FORA: Fast-Forward Caching in Diffusion Transformer Acceleration
- $\Delta$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
- Real-Time Video Generation with Pyramid Attention Broadcast
- Adaptive Caching for Faster Video Generation with Diffusion Transformers
- FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality
- Classifier-Free Diffusion Guidance
- Less is Enough: Training-Free Video Diffusion Acceleration via Runtime-Adaptive Caching
- DiCache: Let Diffusion Model Determine Its Own Cache
- Open-Sora: Democratizing Efficient Video Production for All
- Wan: Open and Advanced Large-Scale Video Generative Models
- CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models