AdaPilot: Towards Scene-Adaptive Policy Learning for Cross-Generator Text-to-Image Quality Optimization
cs.CV, cs.CE
Submitted: 2026-08-25
Updated: 2026-08-25
Code: https://github.com/QwenQKing/Ada
Terminology
Sources
- Qwen2.5-VL Technical Report
- Training Diffusion Models with Reinforcement Learning
- Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
- PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework
- Directly Fine-Tuning Diffusion Models on Differentiable Rewards
- Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis
- ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
- Evaluation of Best-of-N Sampling Strategies for Language Model Alignment
- T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
- GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
- Flow-GRPO: Training Flow Matching Models via Online RL
- ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement
- Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
- Improving Text-to-Image Consistency via Automatic Prompt Optimization
- Aligning Text-to-Image Diffusion Models with Reward Backpropagation
- LongCat-Image Technical Report
- Minority-Focused Text-to-Image Generation via Prompt Optimization
- TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
- Ovis-Image Technical Report
- PromptEnhancer: A Simple Approach to Enhance Text-to-Image Models via Chain-of-Thought Prompt Rewriting
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models