Auditory Illusion Benchmark for Large Audio Language Models
cs.SD, cs.AI
Submitted: 2026-09-02
Updated: 2026-09-02
Code: https://github.com/gillosae/aib
Terminology
Sources
- AudioPaLM: A Large Language Model That Can Speak and Listen
- Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models
- Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities
- GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
- Audio-Reasoner: Improving Reasoning Capability in Large Audio Language Models
- Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
- SUPERB: Speech processing Universal PERformance Benchmark
- AudioBench: A Universal Benchmark for Audio Large Language Models
- MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
- AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
- MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
- IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
- Voxtral
- Kimi-Audio Technical Report
- Fun-Audio-Chat Technical Report
- Qwen2-Audio Technical Report
- GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment