Song, Mengbo. “From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities”. Mathematical Modeling and Algorithm Application, vol. 9, no. 3, Aug. 2026, pp. 134-7, https://doi.org/10.54097/mzt6hz16.