YODAS v3: Over 1 Million Hours of High-Bandwidth, Stereophonic, Multilingual Speech
cs.CL
Submitted: 2026-09-24
Updated: 2026-09-24
Terminology
Sources
- Moshi: a speech-text foundation model for real-time dialogue
- Seamless: Multilingual Expressive and Streaming Speech Translation
- SeamlessM4T: Massively Multilingual & Multimodal Machine Translation
- Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages
- SAM Audio: Segment Anything in Audio
- Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation
- Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Scaling Speech Technology to 1,000+ Languages
- Qwen2-Audio Technical Report
- Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
- AudioChat: Unified Audio Storytelling, Editing, and Understanding with Transfusion Forcing
- Less is More: Data Curation Matters in Scaling Speech Enhancement
- mHuBERT-147: A Compact Multilingual HuBERT Model
- Canary-1B-v2 & Parakeet-TDT-0.6B-v3: Efficient and High-Performance Models for Multilingual ASR and AST
- ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech
- VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering