[1]
Song, M. 2026. From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities. Mathematical Modeling and Algorithm Application. 9, 3 (Aug. 2026), 134–137. DOI:https://doi.org/10.54097/mzt6hz16.