CompAdapt: Adaptable Composite Motion Modeling for Physics-Consistent Text-to-Video Generation
cs.CV
Submitted: 2026-09-18
Updated: 2026-09-24
Terminology
Sources
- OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
- VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
- Physion: Evaluating Physical Prediction from Vision in Humans and Machines
- VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
- A Physical Coherence Benchmark for Evaluating Video Generation Models via Optical Flow-guided Frame Prediction
- Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
- Lagrangian Neural Networks
- Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals
- Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals
- T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation
- AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
- CameraCtrl: Enabling Camera Control for Text-to-Video Generation
- Mojito: Motion Trajectory and Intensity Control for Video Generation
- Imagen Video: High Definition Video Generation with Diffusion Models
- VBench: Comprehensive Benchmark Suite for Video Generative Models
- VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
- Epipolar Geometry Improves Video Generation Models
- MagicMotion: Controllable Video Generation with Dense-to-Sparse Trajectory Guidance
- I-PHYRE: Interactive Physical Reasoning
- MotionAgent: Fine-grained Controllable Video Generation via Motion Field Agent
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models