When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

arXiv:2608.31035 · cs.CL, cs.SD, eess.AS · Submitted 2026-08-31 · Read on arXiv

cs.CL, cs.SD, eess.AS

Submitted: 2026-08-31

Updated: 2026-08-31

Code: https://github.com/sizigi/animeGRPO.1

Project page: https://sizigi.github.io

Terminology

Sources

Related papers