@misc{indiciaef105ede16636, title = {RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training}, author = {Yugu Li and Zehong Cao and Jianglin Qiao and Siyi Hu}, year = {2026}, url = {https://arxiv.org/abs/2608.18682}, note = {Source identifier: 2608.18682} }