Contamination, Prior, or Evidence? Decomposing and Training Evidence Use in Whole-Slide Vision-Language Models
cs.CV, cs.LG
Submitted: 2026-09-26
Updated: 2026-09-26
Terminology
Sources
- Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering
- LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Are We on the Right Way for Evaluating Large Vision-Language Models?
- SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding
- LongNet: Scaling Transformers to 1,000,000,000 Tokens
- PathFinder: A Multi-Modal Multi-Agent System for Medical Diagnostic Decision-Making Applied to Histopathology
- PathVQA: 30000+ Questions for Medical Visual Question Answering
- Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding
- NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
- WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
- Improved Baselines with Visual Instruction Tuning
- WSI-Agents: A Collaborative Multi-Agent System for Multi-Modal Whole Slide Image Analysis
- MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
- Enhancing Pathological VLMs with Cross-scale Reasoning
- PRISM: A Multi-Modal Generative Foundation Model for Slide-Level Histopathology
- CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology
- CPathAgent: An Agent-based Foundation Model for Interpretable High-Resolution Pathology Image Analysis Mimicking Pathologists' Diagnostic Logic
- mDPO: Conditional Preference Optimization for Multimodal Large Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models