EXAM squared: tending udio Understanding in ultilingual and ultimodal Analysis

arXiv:2608.23758 · cs.SD, cs.AI · Submitted 2026-08-24 · Read on arXiv

cs.SD, cs.AI

Submitted: 2026-08-24

Updated: 2026-08-27

Comments: 8 pages, 2 figures

Code: https://github.com/werywjw/EXAM-2

License: http://creativecommons.org/licenses/by/4.0/

The gist: Recent large audio language models (LALMs) have achieved impressive progress in audio understanding.

Terminology

Abstract

Recent large audio language models (LALMs) have achieved impressive progress in audio understanding. However, existing evaluations remain largely constrained to English and narrow audio domains. Prior benchmarks typically focus on a single audio modality, i.e., speech, sound, or music, limiting the systematic investigation into how these models generalize across diverse visual scenarios. In this paper, we introduce EXAM squared, a benchmark for multilingual and multimodal audio understanding spanning six languages and multiple modalities, including speech, sound, music, mixed-audio settings, and visual images. By incorporating visual information alongside heterogeneous audio inputs, EXAM squared enables more realistic evaluation of scene-aware audio reasoning and cross-modal comprehension. EXAM squared comprises 5,667 multiple-choice questions, 22,614 image instances, and 135,684 multilingual translations. We evaluate state-of-the-art open-source and proprietary LALMs as well as multimodal LLMs, revealing substantial performance gaps in multilingual and cross-modal understanding. Furthermore, we propose Gemma3n-EXAM squared, a lightweight fusion-model fine-tuned on EXAM squared-train, achieves up to 12.4% improvement in multilingual settings and 21.7% gains in multimodal evaluation over a strong baseline. Empirical results establish EXAM squared as a challenging benchmark and pioneer future multilingual and multimodal audio intelligence research.

Sources

Related papers