Song, M. (2026) “From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities”, Mathematical Modeling and Algorithm Application, 9(3), pp. 134–137. doi:10.54097/mzt6hz16.