InfoEdit: Probing Global Layout Reasoning in Infographic Editing
cs.CV, cs.CL, cs.SE
Submitted: 2026-09-27
Updated: 2026-09-27
Project page: https://infoedit
Terminology
Sources
- HunyuanImage 3.0 Technical Report
- Emerging Properties in Unified Multimodal Pretraining
- Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
- SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
- PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding
- HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
- PostDoc: Generating Poster from a Long Multimodal Document Using Deep Submodular Optimization
- CompBench: Benchmarking Complex Instruction-guided Image Editing
- GEditBench v2: A Human-Aligned Benchmark for General Image Editing
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing
- BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation
- ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation
- UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
- Step1X-Edit: A Practical Framework for General Image Editing
- WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing
- Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
- VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing
- IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation
- Asymmetric Idiosyncrasies in Multimodal Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models