Mathematical Reasoning on AIME 24 (pass@1, pass@16)
26Pass@1EVOL-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 26 | 51.7 | |
| EVOL-RLBase Model Size=8B, Training Dataset=AIME242025.09 | 25.4 | 38.1 | |
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 24.1 | 49.5 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 20.7 | 47.6 | |
| EVOL-RLBase Model Size=4B, Training Dataset=AIME242025.09 | 20.6 | 40.9 | |
| TTRLBase Model Size=8B, Training Dataset=AIME242025.09 | 20 | 20 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 19 | 43.2 | |
| TTRLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 17.7 | 40.1 | |
| TTRLBase Model Size=4B, Training Dataset=AIME242025.09 | 16.7 | 16.7 | |
| TTRLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 16.7 | 37.6 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 12.1 | 23.2 | |
| Qwen3-8B-BaseBase Model Size=8B, Training Dataset=-2025.09 | 12 | 39.4 | |
| Qwen3-4B-BaseBase Model Size=4B, Training Dataset=-2025.09 | 10 | 32.4 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 10 | 28 |