Song, Mengbo. “From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities”. Mathematical Modeling and Algorithm Application 9, no. 3 (August 4, 2026): 134–137. Accessed September 7, 2026. https://drpress.org/ojs/index.php/mmaa/article/view/35526.