Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation
cs.CV
Submitted: 2026-06-01
Updated: 2026-09-24
Terminology
Sources
- Cosmos World Foundation Model Platform for Physical AI
- Condensed Movies: Story Based Retrieval with Contextual Embeddings
- Uni3C: Unifying Precisely 3D-Enhanced Camera and Human Motion Controls for Video Generation
- AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
- Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
- CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- SOMA: Unifying Parametric Human Body Models
- Wan: Open and Advanced Large-Scale Video Generative Models
- EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance
- VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation
- VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models