ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Project page: https://correr-zhou.github.io/ThinkV2V
Terminology
Sources
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models
- OmniGen2: Towards Instruction-Aligned Multimodal Generation
- HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images
- Qwen-Image Technical Report
- OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
- Omni-Video: Democratizing Unified Video Understanding and Generation
- OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
- UniVideo: Unified Understanding, Generation, and Editing for Videos
- SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
- An Empirical Study of GPT-4o Image Generation Capabilities
- In-Context Learning with Unpaired Clips for Instruction-based Video Editing
- Qwen3-VL Technical Report
- Wan: Open and Advanced Large-Scale Video Generative Models
- ImgEdit: A Unified Image Editing Dataset and Benchmark
- Step1X-Edit: A Practical Framework for General Image Editing
- X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning
- InstructX: Towards Unified Visual Editing with MLLM Guidance
- Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance
- SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models