PoDAR: Power-Decoupled Audio Representation for Generative Modeling
eess.AS, cs.AI, cs.LG, cs.SD
Submitted: 2026-05-11
Updated: 2026-09-26
Code: https://github.com/Stability-AI/stable-audio-tools
Terminology
Sources
- AudioLDM: Text-to-Audio Generation with Latent Diffusion Models
- Diffusion Transformers with Representation Autoencoders
- Moshi: a speech-text foundation model for real-time dialogue
- DualCodec: A Low-Frame-Rate, Semantically-Enhanced Neural Audio Codec for Speech Generation
- Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
- What matters for Representation Alignment: Global Information or Spatial Structure?
- Seamless: Multilingual Expressive and Streaming Speech Translation
Related papers
- X-VC: Zero-shot Streaming Voice Conversion in Codec Space
- Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
- Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
- Towards Audio Token Compression in Large Audio Language Models
- WaveScat: Wavelet Scattering Front-Ends with Self-Supervised Features for Speech Deepfake Detection
- ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions