@misc{indiciaec9d4a84de18d, title = {Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards}, author = {Leqi Zheng and Jinbo Su and Fang Niu and Chaokun Wang and Weiping Wang and Jiajun Zhang and Shannan Yan and Jie Wu and Zhaolu Kang and Rong Fu and Hang Zhang}, year = {2026}, url = {https://arxiv.org/abs/2609.03342}, note = {Source identifier: 2609.03342} }