Connected Self Forcing: Beyond Local Learning in Video Autoregression
cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/MiniMax-AI/MiniMax-H3
Terminology
Sources
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- SkyReels-V2: Infinite-length Film Generative Model
- VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
- Context Forcing: Consistent Autoregressive Video Generation with Long Context
- LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation
- LongVie 2: Multimodal Controllable Ultra-Long Video World Model
- AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
- Latent Video Diffusion Models for High-Fidelity Long Video Generation
- Imagen Video: High Definition Video Generation with Diffusion Models
- CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
- Memory Forcing: Spatio-Temporal Memory for Consistent Scene Generation on Minecraft
- Vid2World: Crafting Video Diffusion Models to Interactive World Models
- VideoPoet: A Large Language Model for Zero-Shot Video Generation
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Video Generators are Robot Policies
- VideoFusion: Decomposed Diffusion Models for High-Quality Video Generation
- Latte: Latent Diffusion Transformer for Video Generation
- TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment
- Movie Gen: A Cast of Media Foundation Models
- Progressive Distillation for Fast Sampling of Diffusion Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models