Song, M. (2026). From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities. Mathematical Modeling and Algorithm Application, 9(3), 134-137. https://doi.org/10.54097/mzt6hz16