TV-AudioRemover: Joint Text-Visual Guided Sound Removal with Multi-Task Hard-Mixture Curriculum
cs.MM, cs.CV, cs.SD
Submitted: 2026-09-22
Updated: 2026-09-22
Project page: https://yjx-research.github.io/TV-AudioRemover
Terminology
Sources
- From Understanding to Erasing: Towards Complete and Stable Video Object Removal
- From Ideal to Real: Stable Video Object Removal under Imperfect Conditions
- Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal
- SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing
- Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits
- MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model
- SAM Audio: Segment Anything in Audio
- Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion
- DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast
- AudioMorphix: Training-free audio editing with diffusion probabilistic models
- Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
- UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion
- Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training
- Object-AVEdit: An Object-level Audio-Visual Editing Model
- InstructAV2AV: Instruction-Guided Audio-Video Joint Editing
- JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation
- Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
- Seedance 2.0: Advancing Video Generation for World Complexity
- AST: Audio Spectrogram Transformer
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
Related papers
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
- Mitigating GenAI-powered Evidence Pollution for Out-of-Context Multimodal Misinformation Detection
- A Rate-Distortion-Classification Approach for Lossy Image Compression