Mathematical Reasoning on AMC (pass@1, pass@16)
58.8pass@1EVOL-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 58.8 | 86 | |
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 55.5 | 86.1 | |
| EVOL-RLBase Model Size=8B, Training Dataset=AIME242025.09 | 54.4 | 85.8 | |
| TTRLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 53.6 | 74 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 51.4 | 80.3 | |
| TTRLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 51.1 | 79.1 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 50.3 | 82.2 | |
| EVOL-RLBase Model Size=4B, Training Dataset=AIME242025.09 | 49.9 | 80.9 | |
| TTRLBase Model Size=8B, Training Dataset=AIME242025.09 | 49.5 | 69.1 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 47.6 | 72 | |
| TTRLBase Model Size=4B, Training Dataset=AIME242025.09 | 43.6 | 65.8 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 42.5 | 75.2 | |
| Qwen3-4B-BaseBase Model Size=4B, Training Dataset=-2025.09 | 39.3 | 75.2 | |
| Qwen3-8B-BaseBase Model Size=8B, Training Dataset=-2025.09 | 38.7 | 77.6 |