GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

arXiv:2602.12316 · cs.AI, cs.CL, cs.CY, cs.GT, cs.MA · Submitted 2026-02-12 · Read on arXiv

cs.AI, cs.CL, cs.CY, cs.GT, cs.MA

Submitted: 2026-02-12

Updated: 2026-09-25

Code: https://github.com/causalNLP/gt-harmbench

Terminology

Sources

Related papers