Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design

arXiv:2505.11821 · cs.LG · Submitted 2026-08-21 · Read on arXiv

Quan Wei, Siliang Zeng, Chenliang Li, Zhongruo Wang, William Brown, Oana Frunza, Wei Deng, Anderson Schneider, Yuriy Nevmyvaka, Yang Katie Zhao, Alfredo Garcia, Mingyi Hong

cs.LG

Submitted: 2026-08-21

Updated: 2026-08-24

Code: https://github.com/willccbb/verifiers

Terminology

Sources

Related papers