Vorch-Human: Unified Multi-Task Human-Centric Generation via Long-Horizon Continuation
cs.CV
Submitted: 2026-08-06
Updated: 2026-08-06
Project page: https://vorch-project.github.io/Vorch-Human-Project
Terminology
Sources
- ALIVE: Animate Your World with Lifelike Audio-Video Generation
- HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
- OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
- Seedance 1.0: Exploring the Boundaries of Video Generation Models
- DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- Wan-S2V: Audio-Driven Cinematic Video Generation
- OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation
- Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation
- Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
- FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes
- Phantom: Subject-consistent video generation via cross-modal alignment
- Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model
- SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
- HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration
- Wan: Open and Advanced Large-Scale Video Generative Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models