RoLA: Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers
cs.CV
Submitted: 2026-09-06
Updated: 2026-09-21
Terminology
Sources
- SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation
- Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile
- SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer
- LTX-Video: Realtime Video Latent Diffusion
- Flow Matching for Generative Modeling
- Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers
- RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers
- OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
- Linearized Relative Positional Encoding
- RoFormer: Enhanced Transformer with Rotary Position Embedding
- SLA2: Sparse-Linear Attention with Learnable Routing and QAT
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
- SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models