Which Constraints Are Missing? Ask the Verifier: Graded Rewards for Constraint-Following Music Generation
cs.SD, cs.AI
Submitted: 2026-09-20
Updated: 2026-09-20
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- MusicLM: Generating Music From Text
- MusicRL: Aligning Music Generation to Human Preferences
- The Llama 3 Herd of Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton
- Music Transformer
- Symbolic Music Generation with Non-Differentiable Rule Guided Diffusion
- SMART: Tuning a symbolic music generation system with an audio domain aesthetic reward
- Incorporating Structure and Chord Constraints in Symbolic Transformer-based Melodic Harmonization
- Tulu 3: Pushing Frontiers in Open Language Model Post-Training
- Understanding R1-Zero-Like Training: A Critical Perspective
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Music transcription modelling and composition using deep learning
- Anticipatory Music Transformer
- NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms
- Towards an AI Musician: Synthesizing Sheet Music Problems for Musical Reasoning
- TunesFormer: Forming Irish Tunes with Control Codes by Bar Patching
- Qwen3 Technical Report
- Instruction-Following Evaluation for Large Language Models
Related papers
- Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement
- Spectral Masking and Interpolation Attack (SMIA): A Black-box Adversarial Attack against Voice Authentication and Anti-Spoofing Systems
- AVMeme Exam: A Multimodal Multilingual Multicultural Benchmark for LLMs' Contextual and Cultural Knowledge and Thinking
- SoundWeaver: Compositional Warm-Starting for Text-to-Audio Diffusion Serving
- WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
- Efficient Audiovisual Speech Processing via MUTUD: Multimodal Training and Unimodal Deployment