Mathematical Reasoning on AIME 2024 (avg@16 accuracy, pass@8)
65.8Avg Accuracy @16TEMPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| TEMPOBackbone=Qwen3-14B-Base2026.04 | 65.8 | 73.3 | |
| EMPOBackbone=Qwen3-14B-Base2026.04 | 55.6 | 59.7 | |
| TTRLBackbone=Qwen3-14B-Base2026.04 | 53.1 | 56.7 | |
| TEMPOBackbone=OLMO3-7B-Base2026.04 | 51.1 | 61.6 | |
| TEMPOBackbone=Qwen3-8B-Base2026.04 | 42.7 | 61.1 | |
| Zero-RL (PPO)Backbone=Qwen3-14B-Base2026.04 | 42.3 | 69.1 | |
| EMPOBackbone=OLMO3-7B-Base2026.04 | 41.6 | 43.3 | |
| TTRLBackbone=OLMO3-7B-Base2026.04 | 40.8 | 45.6 | |
| MiMo-Zero-RL-7BBackbone=MiMo-Zero-RL-7B2026.04 | 37.7 | 63.9 | |
| Zero-RL (PPO)Backbone=OLMO3-7B-Base2026.04 | 33 | 56.1 | |
| EMPOBackbone=Qwen3-8B-Base2026.04 | 32.3 | 26.7 | |
| OLMO3.1-Zero-RL-7BBackbone=OLMO3.1-Zero-RL-7B2026.04 | 31.9 | 56.3 | |
| Oat-Zero-7BBackbone=Oat-Zero-7B2026.04 | 30.2 | 46.1 | |
| TTRLBackbone=Qwen3-8B-Base2026.04 | 29 | 30 | |
| Zero-RL (PPO)Backbone=Qwen3-8B-Base2026.04 | 26.3 | 53 |