Look Where It Counts: A Free, Label-Free Visual Evidence Signal for Fine-Grained Vision-Language Reasoning
cs.CV, eess.IV
Submitted: 2026-09-21
Updated: 2026-09-21
Terminology
Sources
- V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs
- SMoLoRA: Exploring and Defying Dual Catastrophic Forgetting in Continual Visual Instruction Tuning
- V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
- LoRA Learns Less and Forgets Less
- MiniLLM: On-Policy Distillation of Large Language Models
- On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- Exploring Simple Siamese Representation Learning
- How to Scale Your EMA
- Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
- Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
- Perception-R1: Advancing Multimodal Reasoning Capabilities of MLLMs via Visual Perception Reward
- CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization
- Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization
- Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
- CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models