SolveEdit: Benchmarking Visual Problem Solving in Generative Models
cs.CV, cs.AI
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/WenjieShu/SolveEdit
Project page: https://wenjieshu.github.io/SolveEdit-project-page
Terminology
Sources
- TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
- BabyVision: Visual Reasoning Beyond Language
- On the Measure of Intelligence
- Emerging Properties in Unified Multimodal Pretraining
- PaLM-E: An Embodied Multimodal Language Model
- UniREditBench: A Unified Reasoning-based Image Editing Benchmark
- Prompt-to-Prompt Image Editing with Cross Attention Control
- Instruct-Imagen: Image Generation with Multi-modal Instruction
- HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
- VideoPoet: A Large Language Model for Zero-Shot Video Generation
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations
- GIE-Bench: Towards Grounded Evaluation for Text-Guided Image Editing
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- HunyuanVideo 1.5 Technical Report
- Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models
- Qwen-Image Technical Report
- MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action
- ReAct: Synergizing Reasoning and Acting in Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models