MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control
cs.CV, cs.AI, cs.CL
Submitted: 2026-04-07
Updated: 2026-08-26
Code: https://github.com/om-ai-lab/VLM-R1
Terminology
Sources
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Think Then Embed: Generative Context Improves Multimodal Embedding
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- ColPali: Efficient Document Retrieval with Vision Language Models
- Video-R1: Reinforcing Video Reasoning in MLLMs
- MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings
- MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model
- Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond
- UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning
- Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
- RzenEmbed: Towards Comprehensive Multimodal Retrieval
- Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
- T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
- SAIL-Embedding Technical Report: Omni-modal Embedding Foundation Model
- Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
- Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
- VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
- ReMatch: Boosting Representation through Matching for Multimodal Retrieval
- Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning
- UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models