Vision-Encoder Behavioral Fingerprints of Image-to-Image Generative Models: A Training-Paradigm-Driven Taxonomy of Six Commercial APIs

arXiv:2606.14787 · cs.CV, cs.CR · Submitted 2026-06-10 · Read on arXiv

cs.CV, cs.CR

Submitted: 2026-06-10

Updated: 2026-09-07

Comments: Version 2 adds Data and code availability. Corpus can be found on Zenodo, DOI 10.5281/zenodo.22258270 and 10.5281/zenodo.22259972 . V2 also includes supplementary material referenced in V1 (Tables S1-S7). All results remain unchanged 22 pages

License: http://creativecommons.org/licenses/by/4.0/

The gist: We study six production image-to-image AI systems (gpt-image-1, Gemini 2.5 Flash Image, Flux Kontext, SDXL img2img, SD3 img2img, and Qwen Image Edit) under a content-adaptive sub-JND adversarial

Terminology

Abstract

We study six production image-to-image AI systems (gpt-image-1, Gemini 2.5 Flash Image, Flux Kontext, SDXL img2img, SD3 img2img, and Qwen Image Edit) under a content-adaptive sub-JND adversarial perturbation pipeline, scoring all outputs by frozen DINOv2 ViT-B/14 token distances against clean references. Across a 3,588-call corpus spanning COCO photographs, CelebA-HQ portraits, and AI-generated inputs, the six systems partition into two image-invariant behavioral bands on a 2D (patch mean, ssim clean) plane: edit-trained models (Flux Kontext, Qwen Edit, Gemini) cluster in a tight band, while T2I-base models adapted at sampling time (SDXL, SD3, gpt-image-1) cluster in a drift band.

Sources

Related papers