Expected Reasoning-Step Return Unifies On-Policy Learning from Rewards and Teachers

arXiv:2609.32674 · cs.AI · Submitted 2026-09-26 · Read on arXiv

cs.AI

Submitted: 2026-09-26

Updated: 2026-09-26

Terminology

Sources

Related papers