TY - RPRT TI - Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information AU - Priyank Agrawal AU - Ankur Samanta AU - Shervin Ghasemlou AU - Boris Vidolov AU - Jalaj Bhandari AU - Kavosh Asadi AU - Daniel Jiang AU - Aditya Modi PY - 2026 UR - https://arxiv.org/abs/2607.19313 ID - 2607.19313 ER -