Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning
Fangxu Yu, Tao Feng, Dehai Min, Zinan Lin, Weijia Xu, Michael Xu, Philip S. Yu, Ge Liu, Tianyi Zhou
cs.SD, cs.CL
Submitted: 2026-08-03
Code: https://github.com/shuaijiang/Ke-Omni-R
Project page: https://audiorubrics.github.io
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Phi-4 Technical Report
- Reward and Guidance through Rubrics: Promoting Exploration to Improve Multi-Domain Reasoning
- AudioRouter: Data Efficient Audio Understanding via RL based Dual Reasoning
- RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
- Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models
- Qwen2-Audio Technical Report
- Kimi-Audio Technical Report
- Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
- Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
- Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
- Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis
- Audio-Maestro: Enhancing Large Audio-Language Models with Tool-Augmented Reasoning
- Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
- Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models
- OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
- Audio-CoT: Exploring Chain-of-Thought Reasoning in Large Audio Language Model
- MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix
- Reward Hacking in Rubric-Based Reinforcement Learning
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment