Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy
cs.CV, cs.MM, cs.SD, eess.AS
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/researchmm/MM-Diffusion
Terminology
Sources
- UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing
- DiffusionAtlas: High-Fidelity Consistent Diffusion Video Editing
- JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion
- Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning
- TrajectoryMover: Generative Movement of Object Trajectories in Videos
- MMTrail: A Multimodal Trailer Video Dataset with Language and Music Descriptions
- Video ControlNet: Towards Temporally Consistent Synthetic-to-Real Video Translation Using Conditional Image Diffusion Models
- Do Joint Audio-Video Generation Models Understand Physics?
- High Fidelity Neural Audio Compression
- $^R$FLAV: Rolling Flow matching for infinite Audio Video generation
- EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing
- Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction
- ALIVE: Animate Your World with Lifelike Audio-Video Generation
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- Classifier-Free Diffusion Guidance
- VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet
- A Simple but Strong Baseline for Sounding Video Generation: Effective Adaptation of Audio and Video Diffusion Models for Joint Generation
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models