UnStep: Training-Free Acceleration of Causal Video Diffusion with Fewer Steps Than Distillation
cs.CV
Submitted: 2026-09-26
Updated: 2026-09-26
Code: https://github.com/facebookresearch/UnStep
Project page: https://y-mansour.github.io/UnStep
Terminology
Sources
- MonarchRT: Efficient Attention for Real-Time Video Generation
- LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
- One-Forcing: Towards Stable One-Step Autoregressive Video Generation
- AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation
- Efficient Autoregressive Video Diffusion with Dummy Head
- Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models
- DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation
- Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation
- Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention
- SDXL-Lightning: Progressive Adversarial Diffusion Distillation
- SlimDiff: Training-Free, Activation-Guided Hands-free Slimming of Diffusion Models
- HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation
- Wan: Open and Advanced Large-Scale Video Generative Models
- Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation
- In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion
- VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory
- Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index
- Helios: Real Real-Time Long Video Generation Model
- Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation
- Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models