Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models
Fali Wang, Ali Al-Lawati, Iliyas Bektas, Jinxuan Fang, Alek Melenski, Tianxiang Zhao, Yao Ma, Suhang Wang
cs.CL, cs.AI, cs.LG
Submitted: 2026-08-02
Updated: 2026-08-14
Comments: Under review
Code: https://github.com/openai/tiktoken
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Qwen Technical Report
- NVIDIA Nemotron 3: Efficient and Open Intelligence
- Training Verifiers to Solve Math Word Problems
- The Llama 3 Herd of Models
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- GPT4Graph: Can Large Language Models Understand Graph Structured Data ? An Empirical Evaluation and Benchmarking
- Rethinking and Benchmarking Large Language Models for Graph Reasoning
- GraphTeam: Facilitating Large Language Model-based Graph Analysis via Multi-Agent Collaboration
- DeepSeek-V3 Technical Report
- Evaluating Large Language Models on Graphs: Performance Insights and Comparative Analysis
- GraphSkill: Documentation-Guided Hierarchical Retrieval-Augmented Coding for Complex Graph Reasoning
- Benchmarking Benchmark Leakage in Large Language Models
- Qwen3 Technical Report
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering