Schedule optimization for tau-leaping in masked discrete diffusion
math.ST, cs.LG, stat.ML, stat.TH
Submitted: 2026-09-18
Updated: 2026-10-05
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- A Sharp Fannes-type Inequality for the von Neumann Entropy
- Accelerated Sampling from Masked Diffusion Models via Entropy Bounded Unmasking
- Confidence-Based Decoding is Provably Efficient for Diffusion Language Models
- Optimal Inference Schedules for Masked Diffusion Models
- Non-Asymptotic Convergence of Discrete Diffusion Models: Masked and Random Walk dynamics
- Efficient Sampling with Discrete Diffusion Models: Sharp and Adaptive Guarantees
- Improved Sampling Schedules for Discrete Diffusion Models
- Train for the Worst, Plan for the Best: Understanding Token Ordering in Masked Diffusions
- Error Bounds and Optimal Schedules for Masked Diffusions with Factorized Approximations
- Breaking AR's Sampling Bottleneck: Provable Acceleration via Diffusion Language Models
- Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution
- Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models
- Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data
- Score-Based Generative Modeling through Stochastic Differential Equations
- The data geometry of masking diffusion: Certified-optimal schedules via unmasking growth complexity
- The Cosine Schedule is Fisher-Rao-Optimal for Masked Discrete Diffusion Models
- Adaptation to Intrinsic Dependence in Diffusion Language Models
- Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling
Related papers
- Conformal Prediction for Dyadic Regression Under Complex Missingness
- Bentkus-type asymptotic e-values
- High-Dimensional Asymptotics of Differentially Private PCA
- KL Convergence Guarantees for Score diffusion models under minimal data assumptions
- Geometric bias in eigenspace perturbation under random heterogeneous noise
- On the Asymptotic Inadmissibility of Double Machine Learning Estimators Under Structure-Agnostic Models