[1]
M. Song, “From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities”, MMAA, vol. 9, no. 3, pp. 134–137, Aug. 2026, doi: 10.54097/mzt6hz16.