TY - RPRT TI - Playing social deduction games with reinforcement fine-tuned large language models AU - Lingzhe Zhang AU - Yunpeng Zhai AU - Tong Jia AU - Kening Zheng AU - Chiming Duan AU - Minghua He AU - Zhaoyang Liu AU - Bolin Ding AU - Philip S. Yu AU - Ying Li PY - 2026 UR - https://arxiv.org/abs/2610.04261 ID - 2610.04261 ER -