Window-Diffusion: Accelerating Diffusion Language Model Inference with Windowed Token Pruning and Caching
cs.LG
Submitted: 2026-01-28
Updated: 2026-09-15
Comments: The manuscript has been accepted for APPT 2026. Code is available at https://github.com/vhicrgit/Window-Diffusion
Code: https://github.com/vhicrgit/Window-Diffusion
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models
- Structured Denoising Diffusion Models in Discrete State-Spaces
- Program Synthesis with Large Language Models
- Evaluating Large Language Models Trained on Code
- Training Verifiers to Solve Math Word Problems
- Theoretical Benefit and Limitation of Diffusion Language Model
- Measuring Mathematical Problem Solving With the MATH Dataset
- A Survey on Diffusion Language Models
- Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
- Sequential Diffusion Language Models
- dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
- dKV-Cache: The Cache for Diffusion Language Models
- Scaling up Masked Diffusion Models on Text
- Large Language Diffusion Models
- How Efficient Are Diffusion Language Models? A Critical Examination of Efficiency Evaluation Practices
- Simple and Effective Masked Diffusion Language Models
- Diffusion LLMs Can Do Faster-Than-AR Inference via Discrete Diffusion Forcing
- Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
- DLLMQuant: Quantizing Diffusion-based Large Language Models
- Dream 7B: Diffusion Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks