OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation
cs.CV
Submitted: 2026-09-18
Updated: 2026-09-18
Code: https://github.com/discus0434/aestheti
Project page: https://wxliii.github.io/OmniVBench/7
Terminology
Sources
- Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models
- VINO: A Unified Visual Generator with Interleaved OmniModal Context
- Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset
- Wan-Animate: Unified Character Animation and Replacement with Holistic Replication
- DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
- LTX-Video: Realtime Video Latent Diffusion
- HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
- Kling-Omni Technical Report
- Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding
- Bernini: Latent Semantic Planning for Video Diffusion
- OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning
- Seedance 2.0: Advancing Video Generation for World Complexity
- Wan: Open and Advanced Large-Scale Video Generative Models
- HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation
- Unified Reward Model for Multimodal Understanding and Generation
- HunyuanVideo 1.5 Technical Report
- Qwen-Image Technical Report
- LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing
- CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
- MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models