TY - RPRT TI - BoT-GRPO: Efficient Process-Reward RL for Reasoning via Bag-of-Token Aggregation AU - Yingxiang Yang AU - Weihang Xiao AU - Zhunxuan Wang AU - Joshua Flashner AU - Niresh Agarwal PY - 2026 UR - https://arxiv.org/abs/2610.09804 ID - 2610.09804 ER -