Faster Block-Diffusion Serving with Distribution-Free Risk Guarantees
cs.CL, cs.LG
Submitted: 2026-09-27
Updated: 2026-09-27
Code: https://github.com/js-lee-AI/Redline
Terminology
Sources
- Program Synthesis with Large Language Models
- LLaDA2.0: Scaling Up Diffusion Language Models to 100B
- LLaDA2.1: Speeding Up Text Diffusion via Token Editing
- Confidence-Based Decoding is Provably Efficient for Diffusion Language Models
- Accelerating Large Language Model Decoding with Speculative Sampling
- Evaluating Large Language Models Trained on Code
- DMax: Aggressive Parallel Decoding for dLLMs
- Training Verifiers to Solve Math Word Problems
- LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale
- QLoRA: Efficient Finetuning of Quantized LLMs
- Statistically Valid Post-Training Hyperparameter Selection: From Tuning to Guarantees
- Multi-Block Diffusion Language Models
- DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models
- Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards
- Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models
- Confident Adaptive Language Modeling
- LoPA: Scaling dLLM Inference via Lookahead Parallel Decoding
- Dream 7B: Diffusion Large Language Models
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering