TY - RPRT TI - UniRRM: Unified Reasoning Reward Models Across Languages and Evaluation Paradigms AU - Peng Lai AU - Yichao Du AU - Junchao Wu AU - Weibo Gao AU - Linan Yue AU - Longyue Wang AU - Weihua Luo AU - Derek F. Wong AU - Guanhua Chen PY - 2026 UR - https://arxiv.org/abs/2609.05910 ID - 2609.05910 ER -