TY - RPRT TI - SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning AU - Wei Yang AU - Shawn Li AU - Yuehan Qin AU - Yawei Wang AU - Mingxi Wang AU - Shixuan Li AU - Tiankai Yang AU - Jiate Li AU - Jesse Thomason AU - Xuezhe Ma AU - Yue Zhao PY - 2026 UR - https://arxiv.org/abs/2610.11345 ID - 2610.11345 ER -