Silence is Golden: Mitigating Hallucinations in Large Audio-Language Models via Layer-Weighted Vector Steering
cs.SD, cs.LG, eess.AS
Submitted: 2025-10-14
Updated: 2026-08-31
Terminology
Sources
- Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
- Gemma 3 Technical Report
- TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
- Step-Audio 2 Technical Report
- Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment