@misc{indiciae63d2d7536f12, title = {Can Language Models Learn to Reject Their Own Bad Reasoning Steps?}, author = {Siheng Xiong and Xiaoze Liu and Yiqiao Jin and Xiaoqian Wang and Jing Gao}, year = {2026}, url = {https://arxiv.org/abs/2610.05976}, note = {Source identifier: 2610.05976} }