It's Always 10:10: Reference Images Break a Bias That Prompts Only Dent
cs.CV, cs.HC
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/PoisonousBelief/OmniClock
Terminology
Sources
- Extracting Training Data from Diffusion Models
- SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model
- MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
- MultiRef: Controllable Image Generation with Multiple Visual References
- It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models
- GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment
- ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
- TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering
- T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation
- GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
- GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
- Evaluating Text-to-Visual Generation with Image-to-Text Generation
- Stable Bias: Analyzing Societal Representations in Diffusion Models
- CollabEval: Enhancing LLM-as-a-Judge via Multi-Agent Collaboration
- Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs
- Who Evaluates the Evaluations? Objectively Scoring Text-to-Image Prompt Coherence Metrics with T2IScoreScore (TS2)
- Diffusion Art or Digital Forgery? Investigating Data Replication in Diffusion Models
- Paint by Example: Exemplar-based Image Editing with Diffusion Models
- It's About Time: Analog Clock Reading in the Wild
- IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models