RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training

arXiv:2608.18682 · cs.AI · Submitted 2026-08-19 · Read on arXiv

cs.AI

Submitted: 2026-08-19

Updated: 2026-08-31

Terminology

Sources

Related papers