When Can Text Replace Vision? Structural Bottlenecks in Diagram Reasoning
cs.CV
Submitted: 2026-09-30
Updated: 2026-09-30
Code: https://github.com/yunbeizhang/text-for-vision
Terminology
Sources
- Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering
- ICDAR 2019 Competition on Scene Text Visual Question Answering
- OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents
- The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm
- Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering
- DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs
- Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
- Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering
- MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
- VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
- RiVaT-Fuse: Reliability-Calibrated Variational Tensor Fusion with Matrix-Valued Trust for Multimodal Prediction under Modality Uncertainty
- MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
- Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language
- MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
- Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning
- Stop Comparing LLM Agents Without Disclosing the Harness
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models