Think Before You Score: Thinking Reward Model for Visual Generation
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/black-forest-labs/flux
Project page: https://bxhsort.github.io/Thinking-Reward-Model
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
- PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework
- OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing
- Emerging Properties in Unified Multimodal Pretraining
- Leveraging Verifier-Based Reinforcement Learning in Image Editing
- EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation
- ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
- GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
- Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation
- Step1X-Edit: A Practical Framework for General Image Editing
- HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
- RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling
- An Evolutionary Agentic Approach for Open-ended Image Quality Perception
- UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing
- Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models