Conversational Voice Aesthetic Model with Reinforcement Learning from Human Listeners
eess.AS, cs.CL, cs.LG, cs.MM, cs.SD
Submitted: 2026-10-07
Updated: 2026-10-07
Terminology
Sources
- WavReward: Spoken Dialogue Models With Generalist Reward Evaluators
- GSRM: Generative Speech Reward Model for Speech RLHF
- Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
- Qwen3-TTS Technical Report
- Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO
- Qwen2.5-Omni Technical Report
- Qwen3 Technical Report
- Qwen3-Omni Technical Report
- NeMo: a toolkit for building AI applications using Neural Modules
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Related papers
- X-VC: Zero-shot Streaming Voice Conversion in Codec Space
- Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
- Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
- Towards Audio Token Compression in Large Audio Language Models
- WaveScat: Wavelet Scattering Front-Ends with Self-Supervised Features for Speech Deepfake Detection
- ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions