Reasoning-Informed Visual Editing
cs.CV
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/VisionXLab/RISEBench
Terminology
Sources
- Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation
- HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
- LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
- MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
- Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget
- Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
- Emerging Properties in Unified Multimodal Pretraining
- SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
- Commonsense-T2I Challenge: Can Text-to-Image Generation Models Understand Commonsense?
- GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
- WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
- Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
- Prompt-to-Prompt Image Editing with Cross Attention Control
- GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium
- ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
- SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language Models
- MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models