Bernini: Latent Semantic Planning for Video Diffusion
cs.CV, cs.AI, cs.MM
Submitted: 2026-05-21
Updated: 2026-09-02
Code: https://github.com/Dao-AILab/quack
Project page: https://bernini-ai.github.io
Terminology
Sources
- SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints
- Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
- Qwen3-VL Technical Report
- HunyuanImage 3.0 Technical Report
- VINO: A Unified Visual Generator with Interleaved OmniModal Context
- ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
- Consistent Video-to-Video Transfer Using Synthetic Dataset
- Emu3.5: Native Multimodal Models are World Learners
- Emerging Properties in Unified Multimodal Pretraining
- MAGREF: Masked Guidance for Any-Reference Video Generation with Subject Disentanglement
- Flex Attention: A Programming Model for Generating Optimized Attention Kernels
- SkyReels-A2: Compose Anything in Video Diffusion Transformers
- SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
- OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
- VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
- DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models