GUI-GenBench: Evaluating Image Generation Models as Interactive GUI Environments
cs.AI, cs.CV
Submitted: 2026-02-09
Updated: 2026-09-26
Code: https://github.com/stepfun-ai/GEBench
Terminology
Sources
- UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens
- Qwen3-VL Technical Report
- Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Emerging Properties in Unified Multimodal Pretraining
- Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens
- ControlGUI: Guiding Generative GUI Exploration through Perceptual Visual Flow
- Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
- ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
- GPT-4o System Card
- Zero-Shot Prompting Approaches for LLM-based Graphical User Interface Generation
- MobileWorldBench: Towards Semantic World Modeling For Mobile Agents
- Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback
- Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
- Step1X-Edit: A Practical Framework for General Image Editing
- UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesis
- ViMo: A Generative Visual GUI World Model for App Agents
- WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation
- Hierarchical Text-Conditional Image Generation with CLIP Latents
- Seedream 4.0: Toward Next-generation Multimodal Image Generation
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection