E2A-Bench: Benchmarking Evidence-to-Action Reliability in Financial Chart Reasoning
cs.CL
Submitted: 2026-09-13
Updated: 2026-09-13
Comments: EMNLP Findings
Code: https://github.com/wanng-ide/E2A-Bench
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Qwen2.5-VL Technical Report
- Large Language Model Agent in Financial Trading: A Survey
- ChartLlama: A Multimodal LLM for Chart Understanding and Generation
- Qwen3-VL Technical Report
- SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
- FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
- ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
- Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
- FAMMA: A Benchmark for Financial Domain Multilingual Multimodal Question Answering
- PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering