Motion Forcing: A Decoupled Framework for Robust Video Generation in Motion Dynamics
cs.CV
Submitted: 2026-03-11
Updated: 2026-09-26
Code: https://github.com/Tianshuo-Xu/Motion-Forcing
Terminology
Sources
- VideoPhy: Evaluating Physical Commonsense for Video Generation
- Physion: Evaluating Physical Prediction from Vision in Humans and Machines
- Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
- GeoDrive: 3D Geometry-Informed Driving World Model with Precise Action Control
- VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
- STANCE: Motion Coherent Video Generation Via Sparse-to-Dense Anchored Encoding
- Video Prediction Models as Rewards for Reinforcement Learning
- AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
- CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
- GAIA-1: A Generative World Model for Autonomous Driving
- Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation
- How Far is Video Generation from World Model: A Physical Law Perspective
- Learning to Act from Actionless Videos through Dense Correspondences
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
- DrivingDiffusion: Layout-Guided multi-view driving scene video generation with latent diffusion model
- Flow Matching for Generative Modeling
- Physics3D: Learning Physical Properties of 3D Gaussians via Video Diffusion
- Fr'echet Video Motion Distance: A Metric for Evaluating Motion Consistency in Videos
- 4D Driving Scene Generation With Stereo Forcing
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models