Softmax gradient policy for variance minimization and risk-averse multi armed bandits

arXiv:2604.00241 · cs.LG, cs.AI, cs.NA, math.NA · Submitted 2026-03-31 · Read on arXiv

cs.LG, cs.AI, cs.NA, math.NA

Submitted: 2026-03-31

Updated: 2026-09-23

Code: https://github.com/gabriel-turinici/min_variance_and_risk_averse_softmax_MAB

Terminology

Sources

Related papers