TY - RPRT TI - Rethinking On-Policy Distillation of Large Language Models II: One Training Example AU - Zixuan Fu AU - Bingxiang He AU - Yuxin Zuo AU - Haohuan Huang AU - Jinqian Zhang AU - Ruhang Xiao AU - Cheng Qian AU - Qinyu Luo AU - Huan-ang Gao AU - Yudong Wang AU - Zhiyuan Liu AU - Ning Ding AU - Chaojun Xiao PY - 2026 UR - https://arxiv.org/abs/2609.04172 ID - 2609.04172 ER -