Timestep Weighting: A Hidden Key to Effective ELBO-Based Flow-Matching RL
cs.LG, cs.AI, cs.CV
Submitted: 2026-09-26
Updated: 2026-10-05
Terminology
Sources
- Training Diffusion Models with Reinforcement Learning
- Directly Fine-Tuning Diffusion Models on Differentiable Rewards
- DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models
- Denoising Diffusion Probabilistic Models
- Elucidating the Design Space of Diffusion-Based Generative Models
- Denoising Task Difficulty-based Curriculum for Training Diffusion Models
- Adaptive Non-uniform Timestep Sampling for Accelerating Diffusion Model Training
- Understanding Diffusion Objectives as the ELBO with Simple Data Augmentation
- Aligning Text-to-Image Models using Human Feedback
- Flow Matching for Generative Modeling
- Flow-GRPO: Training Flow Matching Models via Online RL
- Flow Matching Policy Gradients
- Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Curriculum Sampling: A Two-Phase Curriculum for Efficient Training of Flow Matching
- V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think
- Diffusion Model Alignment Using Direct Preference Optimization
- A Closer Look at Time Steps is Worthy of Triple Speed-Up for Diffusion Model Training
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks