Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
cs.CV, cs.AI
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/genmoai/models
Project page: https://yuci-gpt.github.io/SplitMoE
Terminology
Sources
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- HunyuanImage 3.0 Technical Report
- Scaling Diffusion Transformers to 16 Billion Parameters
- Seedance 1.0: Exploring the Boundaries of Video Generation Models
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding
- DeepSeek-V3 Technical Report
- Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe
- OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning
- Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k
- MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation
- DiffMoE: Dynamic Token Selection for Scalable Diffusion Transformers
- LongCat-Video Technical Report
- Wan: Open and Advanced Large-Scale Video Generative Models
- Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance
- TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
- CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models