TY - RPRT TI - Can Language Models Learn to Reject Their Own Bad Reasoning Steps? AU - Siheng Xiong AU - Xiaoze Liu AU - Yiqiao Jin AU - Xiaoqian Wang AU - Jing Gao PY - 2026 UR - https://arxiv.org/abs/2610.05976 ID - 2610.05976 ER -