ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation
cs.CV, cs.AI
Submitted: 2025-12-08
Updated: 2026-09-01
Code: https://github.com/ziyang1106/ContextAnyone
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation
- OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions
- VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
- CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance
- MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
- SkyReels-A2: Compose Anything in Video Diffusion Transformers
- LTX-Video: Realtime Video Latent Diffusion
- CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers
- ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
- VACE: All-in-One Video Creation and Editing
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Phantom: Subject-consistent video generation via cross-modal alignment
- Decoupled Weight Decay Regularization
- OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
- Make-A-Video: Text-to-Video Generation without Text-Video Data
- Wan: Open and Advanced Large-Scale Video Generative Models
- ModelScope Text-to-Video Technical Report
- EchoShot: Multi-Shot Portrait Video Generation
- Qwen3 Technical Report
- CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models