SONG, Mengbo. From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities. Mathematical Modeling and Algorithm Application, [S. l.], v. 9, n. 3, p. 134–137, 2026. DOI: 10.54097/mzt6hz16. Disponível em: https://drpress.org/ojs/index.php/mmaa/article/view/35526. Acesso em: 6 sep. 2026.