LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis
cs.LG, cs.AI, cs.CL, cs.MA
Submitted: 2026-05-28
Updated: 2026-09-05
Code: https://github.com/zjunlp/DataMind
Terminology
Sources
- OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
- WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?
- Spider2-V: How Far Are Multimodal Agents From Automating Data Science and Engineering Workflows?
- ConDABench: Interactive Evaluation of Language Models for Data Analysis
- MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering
- Large Language Model-based Data Science Agent: A Survey
- DABstep: Data Agent Benchmark for Multi-step Reasoning
- The BrowserGym Ecosystem for Web Agent Research
- PAL: Program-aided Language Models
- Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning
- DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based Reasoning
- Prometheus: Inducing Fine-grained Evaluation Capability in Language Models
- StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models
- Data Interpreter: An LLM Agent For Data Science
- IDA-Bench: Evaluating LLMs on Interactive Guided Data Analysis
- SheetCopilot: Bringing Software Productivity to the Next Level through Large Language Models
- DataClaw: An Autonomous Data Agent with Instant Messaging Integration
- Tapilot-Crossing: Benchmarking and Evolving LLMs Towards Interactive Data Analysis Agents
- LongDA: Benchmarking LLM Agents for Long-Document Data Analysis
- MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks