LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL
cs.LG, cs.AI, cs.AR
Submitted: 2026-09-03
Updated: 2026-09-03
Code: https://github.com/coderwayne3025/LeanGRPO
Terminology
Sources
- Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models
- Training Diffusion Models with Reinforcement Learning
- DenseGRPO: From Sparse to Dense Reward for Flow Matching Model Alignment
- TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
- Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
- A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning
- Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models
- TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
- Denoising Diffusion Probabilistic Models
- LoRA: Low-Rank Adaptation of Large Language Models
- Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards
- Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation
- PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models
- MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
- DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
- BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models
- AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models
- Flow Matching for Generative Modeling
- DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO
- Flow-GRPO: Training Flow Matching Models via Online RL
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks