Spot, Separate, and Enhance: Fully Generative Approach for Audio Mixing
cs.SD, cs.AI
Submitted: 2026-09-24
Updated: 2026-09-24
Terminology
Sources
- Conditional Flow Matching for Visually-Guided Acoustic Highlighting
- Movie Gen: A Cast of Media Foundation Models
- Perception Encoder: The best visual embeddings are not at the output of the network
- SAM Audio: Segment Anything in Audio
- Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference
- Qwen2-Audio Technical Report
- Audiobox: Unified Audio Generation with Natural Language Prompts
- Fr'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment