(1)
Song, M. From Verifiable Rewards to Autonomous Evolution: Reinforcement Learning-Driven Large Language Model Reasoning Abilities. MMAA 2026, 9 (3), 134-137. https://doi.org/10.54097/mzt6hz16.