Mizar: A 159M-Parameter Audio-Language Model for Audio Understanding
cs.SD, cs.CL
Submitted: 2026-09-23
Updated: 2026-09-23
Code: https://github.com/KaiyangLi1992/Mizar_159M
Terminology
Sources
- Qwen2-Audio Technical Report
- Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
- Layer Normalization
- Paralinguistic Privacy Protection at the Edge
- Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering
- SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model
- M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models
- SALMONN: Towards Generic Hearing Abilities for Large Language Models
- Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
- SARI: Structured Audio Reasoning via Curriculum-Guided Reinforcement Learning
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment