Panoptic Scene Program Diffusion Transformer
cs.CV, cs.LG
Submitted: 2026-09-24
Updated: 2026-09-24
Code: https://github.com/tgxs002/HPSv2
Terminology
Sources
- eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers
- DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?
- GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
- coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation
- Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation
- DeDPO: Debiased Direct Preference Optimization for Diffusion Models
- SANEval: Open-Vocabulary Compositional Benchmarks with Failure-mode Diagnosis
- InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models
- Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
- Object-Attribute Binding in Text-to-Image Generation: Evaluation and Control
- Improving Compositional Text-to-image Generation with Large Vision-Language Models
- Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis
- HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning
- Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings
- LoCo: Locally Constrained Training-Free Layout-to-Image Synthesis
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models