Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision
cs.CV, cs.AI
Submitted: 2025-04-07
Updated: 2026-09-10
Code: https://github.com/black-forest-labs/flux
License: http://creativecommons.org/licenses/by/4.0/
The gist: We present Lunima-OmniLV (abbreviated as OmniLV), a universal multimodal multi-task framework for low-level vision that addresses over 100 sub-tasks across four major categories: image restoration,
Terminology
Abstract
We present Lunima-OmniLV (abbreviated as OmniLV), a universal multimodal multi-task framework for low-level vision that addresses over 100 sub-tasks across four major categories: image restoration, image enhancement, weak-semantic dense prediction, and stylization. OmniLV leverages both textual and visual prompts to offer flexible and user-friendly interactions. Built on Diffusion Transformer (DiT)-based generative priors, our framework supports arbitrary resolutions -- achieving optimal performance at 1K resolution -- while preserving fine-grained details and high fidelity. Through extensive experiments, we demonstrate that separately encoding text and visual instructions, combined with co-training using shallow feature control, is essential to mitigate task ambiguity and enhance multi-task generalization. Our findings also reveal that integrating high-level generative tasks into low-level vision models can compromise detail-sensitive restoration. These insights pave the way for more robust and generalizable low-level vision systems.
Sources
- InstructPix2Pix: Learning to Follow Image Editing Instructions
- Adversarial Diffusion Compression for Real-World Image Super-Resolution
- GPT-4 Technical Report
- Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers
- ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer
- HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
- UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics
- Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- Location-aware Single Image Reflection Removal
- Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
- Discovering Distinctive "Semantics" in Super-Resolution Networks
- Unifying Image Processing as Visual Prompting Question Answering
- Controlling Vision-Language Models for Multi-Task Image Restoration
- ACE++: Instruction-Based Image Creation and Editing via Context-Aware Content Filling
- AutoDIR: Automatic All-in-One Image Restoration with Latent Diffusion
- One Diffusion to Generate Them All
- PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
- Images Speak in Images: A Generalist Painter for In-Context Visual Learning
- Emu3: Next-Token Prediction is All You Need
- SAM 2: Segment Anything in Images and Videos
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models