When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

arXiv:2605.02782 · cs.AI, cs.CL, eess.AS · Submitted 2026-08-18 · Read on arXiv

Pehuén Moure, Niclas Pokel, Bilal Bounajma, Yingqiang Gao, Roman Boehringer, Longbiao Cheng, Shih-Chii Liu

cs.AI, cs.CL, eess.AS

Submitted: 2026-08-18

Updated: 2026-08-20

Code: https://github.com/fixie-ai/ultravox

Terminology

Sources

Related papers