TeDiServe: High SLO Attainment Serving for Diffusion Language Models
cs.LG
Submitted: 2026-06-27
Updated: 2026-09-25
Terminology
Sources
- SDAR: A Synergistic Diffusion-AutoRegression Paradigm for Scalable Sequence Generation
- Mercury: Ultra-Fast Language Models Based on Diffusion
- A Survey on Diffusion Language Models
- dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
- Training Verifiers to Solve Math Word Problems
- Retrieval-Augmented Generation for Large Language Models: A Survey
- LLaMA: Open and Efficient Foundation Language Models
- Fast-dLLM v2: Efficient Block-Diffusion LLM
- Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
- Dream 7B: Diffusion Large Language Models
- Large Language Diffusion Models
- Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference
- LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
- LLaDA-MoE: A Sparse MoE Diffusion Language Model
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks