When Helpful Text Hurts: Option-Redirecting Bias in Vision-Language Models
cs.AI, cs.CV
Submitted: 2026-09-26
Updated: 2026-09-26
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Hallucination of Multimodal Large Language Models: A Survey
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
- Hidden in plain sight: VLMs overlook their visual representations
- Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
- How Do Vision-Language Models Process Conflicting Information Across Modalities?
- Revisiting the Role of Language Priors in Vision-Language Models
- A Survey on Hallucination in Large Vision-Language Models
- Insight Over Sight: Exploring the Vision-Knowledge Conflicts in Multimodal LLMs
- Pointer Sentinel Mixture Models
- Challenges in Understanding Modality Conflict in Vision-Language Models
- Steer LLM Latents for Hallucination Detection
- Web Artifact Attacks Disrupt Vision Language Models
- CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion
- Mitigating Easy Option Bias in Multiple-Choice Question Answering
- Robust Multimodal Large Language Models Against Modality Conflict
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection