VisGraphVar: A Benchmark Generator for Assessing Variability in Graph Analysis Using Large Vision-Language Models
cs.CV, cs.AI, cs.CL, cs.LG
Submitted: 2024-11-22
Updated: 2024-11-22
Journal ref: IEEE Access, vol. 13, pp. 21788-21810, 2025
DOI: 10.1109/ACCESS.2025.3535837
Project page: https://camilochs.github.io/visgraphvar-website
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Vision-Language Models Can Self-Improve Reasoning via Reflection
- BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- Benchmarking and Improving Detail Image Caption
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- The False Promise of Imitating Proprietary LLMs
- Towards Reasoning in Large Language Models: A Survey
- Are Large Vision Language Models up to the Challenge of Chart Comprehension and Reasoning? An Extensive Investigation into the Capabilities and Limitations of LVLMs
- Large Language Models are Zero-Shot Reasoners
- Evaluating Graph Neural Networks for Link Prediction: Current Pitfalls and New Benchmarking
- VisualBERT: A Simple and Performant Baseline for Vision and Language
- Evaluating Object Hallucination in Large Vision-Language Models
- Graph Matching Networks for Learning the Similarity of Graph Structured Objects
- VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
- A Survey on Hallucination in Large Vision-Language Models
- ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks
- Self-Refine: Iterative Refinement with Self-Feedback
- Inverse Scaling: When Bigger Isn't Better
- GPT-4 Technical Report
- Learning Transferable Visual Models From Natural Language Supervision
- Self-Reflection in LLM Agents: Effects on Problem-Solving Performance
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models