Song, Mengbo. 2026. “From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities”. Mathematical Modeling and Algorithm Application 9 (3): 134-37. https://doi.org/10.54097/mzt6hz16.