SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning
cs.SD, cs.AI, cs.CL
Submitted: 2026-08-26
Updated: 2026-08-26
Code: https://github.com/shuaijiang/Ke-Omni-R
Terminology
Sources
- $\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- Moshi: a speech-text foundation model for real-time dialogue
- Incentivizing Consistent, Effective and Scalable Reasoning Capability in Audio LLMs via Reasoning Process Rewards
- VITA: Towards Open-Source Interactive Omni Multimodal LLM
- VoiceAgentBench: Are Voice Assistants ready for agentic tasks?
- ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models
- Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
- Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration
- $\tau$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Retrieval is Cheap, Show Me the Code: Executable Multi-Hop Reasoning for Retrieval-Augmented Generation
- Qwen3-Omni Technical Report
- Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming
- Qwen2.5-Omni Technical Report
- $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment