Soundwich: Video Generation with Layered and Controllable Audio
cs.CV, cs.MM, cs.SD
Submitted: 2026-09-30
Updated: 2026-10-02
Code: https://github.com/CodyNing/Soundwich
Project page: https://soundwich.avdemo.workers.dev
Terminology
Sources
- JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion
- ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text
- SAM Audio: Segment Anything in Audio
- InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models