All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation
cs.CV
Submitted: 2026-09-23
Updated: 2026-09-23
Terminology
Sources
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- Prompt-to-Prompt Image Editing with Cross Attention Control
- JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing
- Taming Visually Guided Sound Generation
- Inference-Time Scaling for Joint Audio-Video Generation
- Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization
- T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
- VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models
- JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion
- SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model
- IDCNet: Guided Video Diffusion for Metric-Consistent RGBD Scene Generation with Precise Camera Control
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- MediaPipe: A Framework for Building Perception Pipelines
- Improving Joint Audio-Video Generation with Cross-Modal Context Learning
- Generating Human Motion Videos using a Cascaded Text-to-Video Framework
- Bringing Objects to Life: training-free 4D generation from 3D objects through view consistent noise
- OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
- ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
- MOVA: Towards Scalable and Synchronized Video-Audio Generation
- UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models