Towards Subject Consistency over Dynamic Subject Sets in Video Generation
cs.CV
Submitted: 2026-10-01
Updated: 2026-10-01
Terminology
Sources
- Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning
- Qwen3-VL Technical Report
- SkyReels-V2: Infinite-length Film Generative Model
- SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer
- Infinite Worlds with Versatile Interactions
- LTX-Video: Realtime Video Latent Diffusion
- VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
- WorldJen: An End-to-End Multi-Dimensional Benchmark for Generative Video Models
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- WorldModelBench: Judging Video Generation Models As World Models
- Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection
- LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
- SAM 2: Segment Anything in Images and Videos
- Proximal Policy Optimization Algorithms
- Seedance 2.0: Advancing Video Generation for World Complexity
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization
- Kling-Omni Technical Report
- Wan: Open and Advanced Large-Scale Video Generative Models
- Video models are zero-shot learners and reasoners
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models