Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning
Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding
cs.CV, cs.AI
Submitted: 2026-08-07
Updated: 2026-08-10
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering
- CRoPS: A Training-Free Hallucination Mitigation Framework for Vision-Language Models
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Hallucination of Multimodal Large Language Models: A Survey
- Breaking Common Sense: WHOOPS! A Vision-and-Language Benchmark of Synthetic and Compositional Images
- CDH-Bench: A Commonsense-Driven Hallucination Benchmark for Evaluating Visual Fidelity in Vision-Language Models
- Evaluating Large Language Models Trained on Code
- How Large Are Lions? Inducing Distributions over Quantitative Attributes
- LFQA-E: Carefully Benchmarking Long-form QA Evaluation
- Multi-Modal Hallucination Control by Visual Information Grounding
- Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts
- LoRA: Low-Rank Adaptation of Large Language Models
- VideoMark: A Distortion-Free Robust Watermarking Framework for Video Diffusion Models
- VLind-Bench: Measuring Language Priors in Large Vision-Language Models
- Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding
- Large Language Models with Controllable Working Memory
- Evaluating Object Hallucination in Large Vision-Language Models
- Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
- Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models