@misc{indiciae078c40f7a25b, title = {Harness-agnostic detection and immunization of reward hacking in self-evolving language models}, author = {Rongxin Yang and Yang Liu and Shang Luo and Haoxuan Jia and Chongyang Zhang and Hao Zheng and Yingguang Yang and Yulin Huang and Jianshen Zhang and Yongzhi Qi and Kefu Xu and Congjing Ran and Bin Chong}, year = {2026}, url = {https://arxiv.org/abs/2609.04665}, note = {Source identifier: 2609.04665} }