1.
Song M. From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities. MMAA [Internet]. 2026 Aug. 4 [cited 2026 Sep. 7];9(3):134-7. Available from: https://drpress.org/ojs/index.php/mmaa/article/view/35526