Beyond Reward Hacking: Proxy Divergence Across Four Layers of a Staged Humanoid Learning Pipeline

arXiv:2610.03196 · cs.RO · Submitted 2026-10-02 · Read on arXiv

cs.RO

Submitted: 2026-10-02

Updated: 2026-10-02

Terminology

Related papers