FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation
eess.AS, cs.AI, cs.SD
Submitted: 2026-01-08
Updated: 2026-08-31
Code: https://github.com/myshell-ai/MeloTTS
Terminology
Sources
- Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
- GPT-4 Technical Report
- Common Voice: A Massively-Multilingual Speech Corpus
- Multilingual and Cross-Lingual Intent Detection from Spoken Data
- Qwen2-Audio Technical Report
- Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech
- Kimi-Audio Technical Report
- Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
- Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models
- The Llama 3 Herd of Models
- Conformer: Convolution-augmented Transformer for Speech Recognition
- Gaussian Error Linear Units (GELUs)
- Long-Form Speech Generation with Spoken Language Models
- A Call for Clarity in Reporting BLEU Scores
- KorQuAD1.0: Korean QA Dataset for Machine Reading Comprehension
- Voxtral
- Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration
- Mixed Precision Training
Related papers
- X-VC: Zero-shot Streaming Voice Conversion in Codec Space
- Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
- Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
- Towards Audio Token Compression in Large Audio Language Models
- WaveScat: Wavelet Scattering Front-Ends with Self-Supervised Features for Speech Deepfake Detection
- ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions