Temporal-Attention Head Specialization During Video Diffusion Training
cs.CV, cs.AI
Submitted: 2026-09-14
Updated: 2026-09-29
Terminology
Sources
- Active-Dormant Attention Heads: Mechanistically Demystifying Extreme-Token Phenomena in LLMs
- LTX-Video: Realtime Video Latent Diffusion
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Understanding Attention Mechanism in Video Diffusion Models
- VDT: General-purpose Video Diffusion Transformers via Mask Modeling
- Emergent Temporal Correspondences from Video Diffusion Transformers
- Progress measures for grokking via mechanistic interpretability
- In-context Learning and Induction Heads
- Wan: Open and Advanced Large-Scale Video Generative Models
- Analysis of Attention in Video Diffusion Transformers
- When Do Attention Circuits Form? Developmental Trajectories of Capability and Attention-Sink Emergence Across Three 1B-ClassArchitectures
- Open-Sora: Democratizing Efficient Video Production for All
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models