VGAS: Variance-Reduced Guidance and Adaptive Selection for Training-Free Reward Alignment in Discrete Diffusion
cs.LG, cs.CE, q-bio.QM, stat.ML
Submitted: 2026-08-27
Updated: 2026-09-17
Terminology
Sources
- Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation
- LPDP: Inference-Time Reward Control for Variable-Length DNA Generation with Edit Flows
- Effective Test-Time Scaling of Discrete Diffusion through Iterative Refinement
- Derivative-Free Guidance in Continuous and Discrete Diffusion Models with Soft Value-Based Decoding
- Reward-Guided Discrete Diffusion via Clean-Sample Markov Chain for Molecule and Biological Sequence Design
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Entropy Aware Reward Guidance for Diffusion Language Model Alignment
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks