How to Run Statistics over LLM Judges and Trust the Results: Calibrated Inference for Small-Sample AI Evaluation with evalstats

arXiv:2609.35815 · cs.CL, cs.AI, cs.HC, stat.ME · Submitted 2026-09-20 · Read on arXiv

cs.CL, cs.AI, cs.HC, stat.ME

Submitted: 2026-09-20

Updated: 2026-09-20

Code: https://github.com/ianarawjo/evalstats

Project page: https://statsforevals.com

Terminology

Sources

Related papers