Editable Visual Design
cs.CV, cs.CL
Submitted: 2026-09-03
Updated: 2026-09-04
Code: https://github.com/yejy53/Editable-Design
Terminology
Sources
- PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework
- Graphic Design with Large Multimodal Model
- Emu3.5: Native Multimodal Models are World Learners
- Emerging Properties in Unified Multimodal Pretraining
- SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture
- UICopilot: Automating UI Synthesis via Hierarchical Code Generation from Webpage Designs
- LaTCoder: Converting Webpage Design to Code with Layout-as-Thought
- Mind-Brush: Integrating Agentic Cognitive Search and Reasoning into Image Generation
- GEMS: Agent-Native Multimodal Generation with Memory and Skills
- OpenCOLE: Towards Reproducible Automatic Graphic Design Generation
- COLE: A Hierarchical Generation Framework for Multi-Layered and Editable Graphic Design
- DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
- Kimi K3: Open Frontier Intelligence
- Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset
- VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
- Seeing Before Reasoning: A Unified Framework for Generalizable and Explainable Fake Image Detection
- SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation
- Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering
- World Action Models: The Next Frontier in Embodied AI
- Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models