Video Generation Models: A Survey of Post-Training and Alignment
cs.CV, cs.AI, cs.LG
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/people-robots/Awesome-Video-Generation-Post-Training
Terminology
Sources
- MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Open-Sora Plan: Open-Source Large Video Generation Model
- VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness
- RDPO: Real Data Preference Optimization for Physics Consistency Video Generation
- Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation
- Zo3T: Zero-Shot 3D-Aware Trajectory-Guided Image-to-Video Generation via Test-Time Training
- InstanceV: Instance-Level Video Generation
- Controllable Video Generation: A Survey
- A Comprehensive Survey on Human Video Generation: Challenges, Methods, and Insights
- Show Me: Unifying Instructional Image and Video Generation with Diffusion Models
- GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning
- ATI: Any Trajectory Instruction for Controllable Video Generation
- Populate-A-Scene: Affordance-Aware Human Video Generation
- OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation
- Consistent Video Editing as Flow-Driven Image-to-Video Generation
- LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning
- PanoLora: Bridging Perspective and Panoramic Video Generation with LoRA Adaptation
- Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models