HuPER: A Human-Inspired Framework for Phonetic Perception
eess.AS, cs.AI
Submitted: 2026-02-02
Updated: 2026-09-25
Code: https://github.com/HuPER29/HuPER
Terminology
Sources
- Mixture of Cognitive Reasoners: Modular Reasoning with Brain-Like Specialization
- POWSM: A Phonetic Open Whisper-Style Speech Foundation Model
- Decoupled Weight Decay Regularization
- Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages
- Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages
Related papers
- X-VC: Zero-shot Streaming Voice Conversion in Codec Space
- Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
- Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
- Towards Audio Token Compression in Large Audio Language Models
- WaveScat: Wavelet Scattering Front-Ends with Self-Supervised Features for Speech Deepfake Detection
- ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions