StepOPSD: Step-Aware Online Preference Self-Distillation for Agent Reinforcement Learning

arXiv:2605.27140 · cs.AI · Submitted 2026-05-26 · Read on arXiv

cs.AI

Submitted: 2026-05-26

Updated: 2026-08-26

Terminology

Sources

Related papers