ExploreNet: Learning Where to Explore in Diffusion GRPO
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/stellalisy/ExploreNet
Terminology
Sources
- Training Diffusion Models with Reinforcement Learning
- FIND: Fine-tuning Initial Noise Distribution with Policy Optimization for Diffusion Models
- Directly Fine-Tuning Diffusion Models on Differentiable Rewards
- Personalized Preference Fine-tuning of Diffusion Models
- Scaling Rectified Flow Transformers for High-Resolution Image Synthesis
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models
- GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment
- TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
- ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
- T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation
- T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
- GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
- Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation
- Spatially Adaptive Noise Injection
- Aligning Text-to-Image Models using Human Feedback
- MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
- Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts
- BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models
- Learning Sampling Parameters for Diffusion Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models