STEPS: Scene Text Editing with Preserved Style Using Diffusion and Contrastive Style Encoding
cs.CV, cs.LG
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- Blended Latent Diffusion
- DiffUTE: Universal Text Editing Diffusion Model
- TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering
- Recognition-Synergistic Scene Text Editing
- Improving Diffusion Models for Scene Text Editing with Dual Encoders
- FLUX-Text: A Simple and Advanced Diffusion Transformer Baseline for Scene Text Editing
- TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models
- Character-Aware Models Improve Visual Text Rendering
- DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps
- Exploring Stroke-Level Modifications for Scene Text Editing
- AnyText2: Visual Text Generation and Editing With Customizable Attributes
- AnyText: Multilingual Visual Text Generation And Editing
- IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models