MG-Thinker: Bi-Axial Self-Reflection for Multi-Image Reasoning Grounding
cs.CV, cs.MM
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/verl-project/verl
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning
- Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
- Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic
- GRIT: Teaching MLLMs to Think with Images
- Hidden in plain sight: VLMs overlook their visual representations
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- OpenAI o1 System Card
- MANTIS: Interleaved Multi-Image Instruction Tuning
- LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
- VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
- GroundingGPT:Language Enhanced Multi-modal Grounding Model
- MIBench: Evaluating Multimodal Large Language Models over Multiple Images
- VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
- DeepSeek-VL: Towards Real-World Vision-Language Understanding
- MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
- MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
- Kosmos-2: Grounding Multimodal Large Language Models to the World
- VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models