Where Compute Matters: Heterogeneous Attention for Efficient Video Diffusion
cs.CV
Submitted: 2026-09-25
Updated: 2026-09-25
Terminology
Sources
- Wan: Open and Advanced Large-Scale Video Generative Models
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- LTX-Video: Realtime Video Latent Diffusion
- Open-Sora Plan: Open-Source Large Video Generation Model
- Accelerating Diffusion Transformers with Token-wise Feature Caching
- Scaling Diffusion Transformers to 16 Billion Parameters
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
- AMD-Hummingbird: Towards an Efficient Text-to-Video Model
- Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds
- MobileWan: Closing the Quality Gap for Mobile Video Diffusion
- HLA: Hadamard Linear Attention
- M4V: Multimodal Mamba for Efficient Text-to-Video Generation
- Qwen3 Technical Report
- Open-Sora: Democratizing Efficient Video Production for All
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models