VibeEdit: Image Editing with Canvas Instructions
cs.CV, cs.AI
Submitted: 2026-10-08
Updated: 2026-10-08
Project page: https://zhaojingjing713.github.io/VibeEdit
Terminology
Sources
- Qwen2.5-VL Technical Report
- Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
- HunyuanImage 3.0 Technical Report
- Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
- RubricRL: Simple Generalizable Rewards for Text-to-Image Generation
- LoRA: Low-Rank Adaptation of Large Language Models
- Step1X-Edit: A Practical Framework for General Image Editing
- Seedream 4.0: Toward Next-generation Multimodal Image Generation
- JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation
- LongCat-Image Technical Report
- FireRed-Image-Edit-1.0 Technical Report
- Qwen-Image Technical Report
- FineEdit: Fine-Grained Image Edit with Bounding Box Guidance
- Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking
- DanceGRPO: Unleashing GRPO on Visual Generation
- How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
- OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models
- Qwen-Image-2.0 Technical Report
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models