NVAlign: Direct-Gradient Optimization for Non-Verbal Control in Continuous Autoregressive Flow Matching Text-to-Speech
cs.SD, cs.AI, cs.CL, eess.AS
Submitted: 2026-09-25
Updated: 2026-09-25
Code: https://github.com/yifan123/flow_grpo
Terminology
Sources
- A Scalable Pipeline for Enabling Non-Verbal Speech Generation and Understanding
- TTS-1 Technical Report
- Fish Audio S2 Technical Report
- Preference Optimization for Non-Verbal Vocalization Synthesis
- VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning
- VoxCPM2 Technical Report
- dots.tts Technical Report
- IndexTTS 2.5 Technical Report
- GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model
- Fr'echet Distance Loss on Speech Representations for Text-to-Speech Synthesis
- Flow-OPD: On-Policy Distillation for Flow Matching Models
- Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like
- NVMOS: Non-Verbal Vocalization Quality Assessment in Speech
- Aligning Text-to-Image Diffusion Models with Reward Backpropagation
- Qwen3-Omni Technical Report
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment