Sufficiency of Zeroth-Order Reward Shaping for Policy Gradient in Stabilization Control

arXiv:2609.34695 · cs.RO, cs.AI · Submitted 2026-09-28 · Read on arXiv

cs.RO, cs.AI

Submitted: 2026-09-28

Updated: 2026-09-28

Terminology

Sources

Related papers