TransPhy: Visual In-Context Learning for Physically Grounded Image Editing
cs.CV, cs.AI
Submitted: 2026-08-25
Updated: 2026-08-25
Terminology
Sources
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- InstructPix2Pix: Learning to Follow Image Editing Instructions
- Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision
- Edit Transfer: Learning Image Editing via Vision In-Context Relations
- Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
- PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
- Emerging Properties in Unified Multimodal Pretraining
- Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing
- DiT4Edit: Diffusion Transformer for Image Editing
- RelationAdapter: Learning and Transferring Visual Relation with Diffusion Transformers
- Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model
- PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
- Customizing Text-to-Image Models with a Single Image Pair
- VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers
- VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
- WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark
- PAR: Prompt-Aware Token Reduction Method for Efficient Large Multimodal Models
- PairEdit: Learning Semantic Variations for Exemplar-based Image Editing
- Spanning the Visual Analogy Space with a Weight Basis of LoRAs
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models