LOCI: A Locator-Critic with Refinement Loop
cs.CV, cs.AI
Submitted: 2026-08-31
Updated: 2026-08-31
License: http://creativecommons.org/licenses/by/4.0/
The gist: Vision-Language Models (VLMs) still struggle on tasks requiring complex visual understanding.
Terminology
Abstract
Vision-Language Models (VLMs) still struggle on tasks requiring complex visual understanding. We argue that the core issue is not high-level reasoning, but instead failing to locate critical details in the image. Due to this shortcoming, VLMs generate often plausible but incorrect reasoning based on flawed perceptual grounding. To address this, we propose Locator-Critic (LOCI), a training-free framework that decouples visual search from evidence verification. LOCI employs a Locator agent to propose candidate visual evidence and a separate Critic agent to evaluate its relevance and sufficiency. These agents engage in an iterative refinement loop, progressively improving the evidence until it is adequate to answer the given question. This decoupled, self-correcting process yields substantial performance gains, achieving state-of-the-art results on multiple complex visual benchmarks. LOCI improves accuracy for both open-weight models like Qwen3-VL (+12.1 on V*, +5.8 on HR-Bench and +11.2 on VisualProbe-Hard) and proprietary models like Gemini 2.5 Pro (+8.9 on V*, +4.3 on HR-Bench, +4.8 on VisualProbe-Hard).
Sources
- Generating CAD Code with Vision-Language Models for 3D Designs
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- GPT-4o System Card
- OpenAI o1 System Card
- Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
- LLaVA-OneVision: Easy Visual Task Transfer
- ToRL: Scaling Tool-Integrated RL
- OpenAI GPT-5 System Card
- Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
- Kimi K2: Open Agentic Intelligence
- LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model
- MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action
- Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
- Generative Universal Verifier as Multimodal Meta-Reasoner
- Thyme: Think Beyond Images
- DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models