YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality
eess.AS, cs.LG, cs.SD
Submitted: 2026-09-27
Updated: 2026-09-27
Code: https://github.com/multimodal-art-projection/YuE
Project page: https://map-yue2.github.io/ABSTRACT
Terminology
Sources
- MusicLM: Generating Music From Text
- ChordFormer: A Conformer-Based Architecture for Large-Vocabulary Audio Chord Recognition
- Discogs-VI: A Musical Version Identification Dataset Based on Public Editorial Metadata
- Seed-Music: A Unified Framework for High Quality and Controlled Music Generation
- SymPAC: Scalable Symbolic Music Generation With Prompts And Constraints
- Qwen2-Audio Technical Report
- Simple and Controllable Music Generation
- Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering
- High Fidelity Neural Audio Compression
- Emerging Properties in Unified Multimodal Pretraining
- Stable Audio Open
- MT3: Multi-Task Multitrack Music Transcription
- ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation
- Frequency-Aware Self-Supervised Music Representation Learning
- SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision
- Music Transformer
- The Platonic Representation Hypothesis
- DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching
- Adam: A Method for Stochastic Optimization
Related papers
- X-VC: Zero-shot Streaming Voice Conversion in Codec Space
- Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
- Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
- Towards Audio Token Compression in Large Audio Language Models
- WaveScat: Wavelet Scattering Front-Ends with Self-Supervised Features for Speech Deepfake Detection
- ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions