Auditing Web Agent Evaluation on WebArena-Lite: Human Review of Outcomes and Trajectories
cs.CL
Submitted: 2026-10-01
Updated: 2026-10-01
Terminology
Sources
- WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?
- The BrowserGym Ecosystem for Web Agent Research
- Scaling Web Agent Training through Automatic Data Generation and Fine-grained Evaluation
- WebLINX: Real-World Website Navigation with Multi-Turn Dialogue
- AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories
- WebGraphEval: Multi-Turn Trajectory Evaluation for Web Agents using Graph Representation
- An Illusion of Progress? Assessing the Current State of Web Agents
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering