TY - RPRT TI - After Cooperation Is Learned: Gradient Routing and Optimizer-Dependent Maintenance in Multi-Agent Reinforcement Learning AU - Chaoyuan Hao AU - Wentao Yue AU - Tianyou Lai AU - Hongji Li AU - Jiayi Zhou AU - Qingyu Mao AU - Qilei Li PY - 2026 UR - https://arxiv.org/abs/2610.01630 ID - 2610.01630 ER -