AEGIS: Audio Endogenous Guarding via Internal Signals Against Large Audio-Language Model Jailbreaks
cs.SD, cs.CR
Submitted: 2026-09-24
Updated: 2026-09-24
Code: https://github.com/azzzzliao/aegis-audio-defense
Terminology
Sources
- Qwen2-Audio Technical Report
- Gemma 4 Technical Report
- VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
- Voxtral
- Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
- Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment
- Multilingual and Multi-Accent Jailbreaking of Audio LLMs
- Universal and Transferable Adversarial Attacks on Aligned Language Models
- VoiceSHIELD-Small: Real-Time Malicious Speech Detection and Transcription
- LLMs Encode Harmfulness and Refusal Separately
- Qwen3-TTS Technical Report
- The Llama 3 Herd of Models
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment