Learning New Words from Unlabeled Test Data in Automatic Speech Recognition
eess.AS, cs.CL
Submitted: 2026-09-24
Updated: 2026-09-24
Terminology
Sources
- Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
- InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
- GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
- Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities
- Qwen2-Audio Technical Report
- Scaling Laws for Neural Language Models
- Qwen3 Technical Report
- Gemma 3 Technical Report
Related papers
- X-VC: Zero-shot Streaming Voice Conversion in Codec Space
- Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
- Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
- Towards Audio Token Compression in Large Audio Language Models
- WaveScat: Wavelet Scattering Front-Ends with Self-Supervised Features for Speech Deepfake Detection
- ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions