LaSR: Context-Aware Speech Recognition via Latent Reasoning
cs.CL
Submitted: 2026-05-30
Updated: 2026-09-17
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Speech LLMs are Contextual Reasoning Transcribers
- CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training
- Training Large Language Models to Reason in a Continuous Latent Space
- Qwen3-TTS Technical Report
- Reinforcement Learning Outperforms Supervised Fine-Tuning: A Case Study on Audio Question Answering
- Data Darwinism Part I: Unlocking the Value of Scientific Data for Pre-training
- Qwen3-ASR Technical Report
- Fun-Audio-Chat Technical Report
- Step-Audio-R1 Technical Report
- Step-Audio 2 Technical Report
- Qwen2.5-Omni Technical Report
- Qwen3-Omni Technical Report
- LIMO: Less is More for Reasoning
- GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
- MiMo-Audio: Audio Language Models are Few-Shot Learners
- Step-Audio-R1.5 Technical Report
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering