ALAS: An Automatic Latent Alignment Score for Audio Language Models
cs.CL, cs.SD, eess.AS
Submitted: 2025-05-26
Updated: 2026-09-27
Code: https://github.com/poonehmousavi/alas979-8-3503-2411-2
Terminology
Sources
- LLaMA: Open and Efficient Foundation Language Models
- Qwen2-Audio Technical Report
- Discrete Audio Tokens: More Than a Survey!
- A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
- Gemini: A Family of Highly Capable Multimodal Models
- AudioPaLM: A Large Language Model That Can Speak and Listen
- Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data
- Eureka-Audio: Triggering Audio Intelligence in Compact Language Models
- SSR: Alignment-Aware Modality Connector for Speech Language Models
- Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition
- AudioBench: A Universal Benchmark for Audio Large Language Models
- LibriSQA: A Novel Dataset and Framework for Spoken Question Answering with Large Language Models
- MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
- Qwen2.5-Omni Technical Report
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering