TY - RPRT TI - When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models AU - Joonyong Park AU - Jerry Li PY - 2026 UR - https://arxiv.org/abs/2608.31035 ID - 2608.31035 ER -