GeoComposer: Geometry-Grounded Photographic Composition Instruction
cs.CV
Submitted: 2026-09-22
Updated: 2026-09-22
Code: https://github.com/unsplash/datasets
Project page: https://geocomposer.github.io
Terminology
Sources
- Qwen3-VL Technical Report
- What matters for Representation Alignment: Global Information or Spatial Structure?
- Unified Reward Model for Multimodal Understanding and Generation
- $\pi^3$: Permutation-Equivariant Visual Geometry Learning
- Emerging Properties in Unified Multimodal Pretraining
- AesFormer: Transform Everyday Photos into Beautiful Memories
- Emergent Outlier View Rejection in Visual Geometry Grounded Transformers
- FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space
- Step1X-Edit: A Practical Framework for General Image Editing
- DiffusionNFT: Online Diffusion Reinforcement with Forward Process
- Qwen-Image Technical Report
- Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers
- Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models