RA-CFGCache: From Branch-Level Criteria to Guided-Risk Control under Classifier-Free Guidance
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/yiming-l21/RA-CFGCache
Terminology
Sources
- Denoising Diffusion Probabilistic Models
- Generative Modeling by Estimating Gradients of the Data Distribution
- Diffusion Models Beat GANs on Image Synthesis
- Scalable Diffusion Models with Transformers
- Adversarial Diffusion Distillation
- Denoising Diffusion Implicit Models
- DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
- Token Pruning for Caching Better: 9 Times Acceleration on Stable Diffusion for Free
- DeepCache: Accelerating Diffusion Models for Free
- LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation
- Faster Diffusion: Rethinking the Role of the Encoder for Diffusion Model Inference
- Real-Time Video Generation with Pyramid Attention Broadcast
- $\Delta$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers
- DiCache: Let Diffusion Model Determine Its Own Cache
- SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching
- Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers
- FasterCache: Training-Free Video Diffusion Model Acceleration with High Quality
- Analysis of Classifier-Free Guidance Weight Schedulers
- Applying Guidance in a Limited Interval Improves Sample and Distribution Quality in Diffusion Models
- MAMBO-G: Magnitude-Aware Mitigation for Boosted Guidance
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models