FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry
cs.CV
Submitted: 2026-07-20
Updated: 2026-09-22
Project page: https://rigyourportrait.github.io
Terminology
Sources
- Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset
- OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
- SAM 3: Segment Anything with Concepts
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- Qwen2.5-VL Technical Report
- Qwen3-VL Technical Report
- Wan: Open and Advanced Large-Scale Video Generative Models
- InstructX: Towards Unified Visual Editing with MLLM Guidance
- VINO: A Unified Visual Generator with Interleaved OmniModal Context
- UNIC: Unified In-Context Video Editing
- Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
- GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
- ImgEdit: A Unified Image Editing Dataset and Benchmark
- RelightMaster: Precise Video Relighting with Multi-plane Light Images
- The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
- EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
- Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
- Multimodal Referring Segmentation: A Survey
- From Ideal to Real: Stable Video Object Removal under Imperfect Conditions
- First Frame Is the Place to Go for Video Content Customization
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models