LIFT: Layout-In-Future Video Generation under Large Viewpoint Change via On-Policy Self-Distillation
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Project page: https://jsxzs.github.io/LIFT
Terminology
Sources
- Qwen3-VL Technical Report
- SAM 3: Segment Anything with Concepts
- Perception-as-Control: Fine-grained Controllable Image Animation with 3D-aware Motion Representation
- Flow-OPD: On-Policy Distillation for Flow Matching Models
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- CameraCtrl: Enabling Camera Control for Text-to-Video Generation
- CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models
- D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
- Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
- Depth Anything 3: Recovering the Visual Space from Any Views
- OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators
- Yume-1.5: A Text-Controlled Interactive World Generation Model
- DINOv2: Learning Robust Visual Features without Supervision
- Seedance 2.0: Advancing Video Generation for World Complexity
- Advancing Open-source World Models
- Towards Accurate Generative Models of Video: A New Metric & Challenges
- Wan: Open and Advanced Large-Scale Video Generative Models
- SpatialVID: A Large-Scale Video Dataset with Spatial Annotations
- EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance
- Qwen-Image-2.0-RL Technical Report
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models