Planning and Rendering in Concert: DeepFusion of Autoregressive Layouts and Diffusion for Visual Text Generation
cs.CV
Submitted: 2026-09-19
Updated: 2026-09-19
Code: https://github.com/kakaobrain/coyo-dataset
Terminology
Sources
- HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer
- BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset
- BLIP3o-NEXT: Next Frontier of Native Image Generation
- PrismLayers: Open Data for High-Quality Multi-Layer Transparent Image Generative Models
- PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework
- Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
- Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement
- Emerging Properties in Unified Multimodal Pretraining
- Investigating Text Insulation and Attention Mechanisms for Complex Visual Text Generation
- Seedream 3.0 Technical Report
- X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
- PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models
- DreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design
- Improving Diffusion Models for Scene Text Editing with Dual Encoders
- ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
- JoyType: A Robust Design for Multilingual Visual Text Creation
- TextCenGen: Attention-Guided Text-Centric Background Adaptation for Text-to-Image Generation
- Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering
- Decoupled Weight Decay Regularization
- Uni-Layout: Integrating Human Feedback in Unified Layout Generation and Evaluation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models