Elucidating the Design Space of Regression-based Diffusion Reinforcement Learning
cs.LG, cs.CV
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs
- Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models
- FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification
- Seedance 1.0: Exploring the Boundaries of Video Generation Models
- Generative Adversarial Networks
- REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
- Distribution Matching Distillation without Fake Score Network
- AdvantageFlow: Regularized Advantage-Weighted RL in Flow Models
- Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning
- Video Diffusion Alignment via Reward Gradients
- Proximal Policy Optimization Algorithms
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping
- V-GRPO: Online Reinforcement Learning for Denoising Generative Models Is Easier than You Think
- Seedance 2.0: Advancing Video Generation for World Complexity
- Qwen-Image Technical Report
- DanceGRPO: Unleashing GRPO on Visual Generation
- Hunyuan3D 1.0: A Unified Framework for Text-to-3D and Image-to-3D Generation
- Qwen-Image-2.0 Technical Report
- Hunyuan3D 2.0: Scaling Diffusion Models for High Resolution Textured 3D Assets Generation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks