InfoAgent: Traceable Generation and Repair of Evidence-Grounded Infographics
cs.CV
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/black-forest-labs/flux
Terminology
Sources
- RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation
- Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
- HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
- Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
- GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation
- SenseNova-MARS: Empowering Multimodal Agentic Reasoning and Search via Reinforcement Learning
- Gen-Searcher: Reinforcing Agentic Search for Image Generation
- Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
- UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction
- IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation
- LongCat-Image Technical Report
- FactFlow: Automatic Fact Sheet Generation and Customization from Tabular Dataset via AI Chain Design & Implementation
- Qwen-Image Technical Report
- Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels
- PreGenie: An Agentic Framework for High-quality Visual Presentation Generation
- M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning
- GenClaw: Code-Driven Agentic Image Generation
- Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models