On-Policy Self-Distillation for Multi-Turn Image Editing
cs.CV, cs.LG
Submitted: 2026-09-28
Updated: 2026-09-28
Project page: https://liangbingzhao.github.io/MT-OPSD
Terminology
Sources
- Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
- Emerging Properties in Unified Multimodal Pretraining
- Flow-OPD: On-Policy Distillation for Flow Matching Models
- Prompt-to-Prompt Image Editing with Cross Attention Control
- MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching
- D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
- OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators
- Step1X-Edit: A Practical Framework for General Image Editing
- Privileged Information Distillation for Language Models
- FireRed-Image-Edit-1.0 Technical Report
- Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space
- Qwen-Image Technical Report
- OmniGen2: Towards Instruction-Aligned Multimodal Generation
- Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
- AnchorEdit: Maintaining Temporal Consistency in Multi-turn Image Editing via Causal Memory
- Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing
- From Statics to Dynamics: Physics-Aware Image Editing with Latent Transition Priors
- Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models