Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning
cs.SD, cs.AI, cs.CR
Submitted: 2026-06-19
Updated: 2026-09-01
Terminology
Sources
- wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations
- data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language
- Targeted Backdoor Attacks on Deep Learning Systems Using Data Poisoning
- Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models
- Towards Stealthy Backdoor Attacks against Speech Recognition via Elements of Sound
- Imperceptible Rhythm Backdoor Attacks: Exploring Rhythm Transformation for Embedding Undetectable Vulnerabilities on Speech Recognition
- EmoBack: Backdoor Attacks Against Speaker Identification Using Emotional Prosody
- UniSpeech-SAT: Universal Speech Representation Learning with Speaker Aware Pre-Training
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment