Mathematical Reasoning on MATH (pass@1, pass@16)
85.7Pass@1TTRL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TTRLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 85.7 | 91.9 | |
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 84.7 | 95.1 | |
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 83.6 | 94.1 | |
| EVOL-RLBase Model Size=8B, Training Dataset=AIME242025.09 | 83.1 | 94.2 | |
| TTRLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 81.1 | 91.1 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 80 | 93.3 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 79.8 | 93.8 | |
| EVOL-RLBase Model Size=4B, Training Dataset=AIME242025.09 | 79.6 | 93.6 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 79.3 | 83.2 | |
| TTRLBase Model Size=8B, Training Dataset=AIME242025.09 | 76.8 | 86.2 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 75.4 | 86.9 | |
| TTRLBase Model Size=4B, Training Dataset=AIME242025.09 | 73.8 | 84.5 | |
| Qwen3-4B-BaseBase Model Size=4B, Training Dataset=-2025.09 | 67.4 | 89.6 | |
| Qwen3-8B-BaseBase Model Size=8B, Training Dataset=-2025.09 | 63.6 | 91.5 |