FSA-GRPO: Teaching Auditory LLMs to Use Few-Shot Demonstrations
eess.AS, cs.AI, cs.SD
Submitted: 2026-05-26
Updated: 2026-08-29
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Advancing Speech Understanding in Speech-Aware Language Models with GRPO
- Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models
- Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
- Audio Flamingo Next: Next-Generation Open Audio-Language Models for Speech, Sound, and Music
- Multimodal In-context Learning for ASR of Low-resource Languages
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
- COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning
- Qwen2.5-Omni Technical Report
- Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages
- Proximal Policy Optimization Algorithms
- TICL+: A Case Study On Speech In-Context Learning for Children's Speech Recognition
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- TICL: Text-Embedding KNN For Speech In-Context Learning Unlocks Speech Recognition Abilities of Large Multimodal Models
- Group Relative Policy Optimization for Speech Recognition
- Towards General Auditory Intelligence: Large Multimodal Models for Machine Listening and Speaking
- MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning
Related papers
- X-VC: Zero-shot Streaming Voice Conversion in Codec Space
- Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
- Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
- Towards Audio Token Compression in Large Audio Language Models
- WaveScat: Wavelet Scattering Front-Ends with Self-Supervised Features for Speech Deepfake Detection
- ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions