Mathematical Reasoning on AIME 24/25, AMC, MATH-500, Minerva, Olympiad
34.2AIME 2024 ScoreBV-Blend
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| BV-BlendBackbone=Qwen2.5-Math-7B, Training Protocol=On-Policy RLVR2026.06 | 34.2 | 23.6 | 66.5 | 87.9 | 40.7 | 57.4 | 51.7 | |
| Oat-ZeroBackbone=Qwen2.5-Math-7B, Training Protocol=On-Policy RLVR2026.06 | 33.4 | 11.9 | 61.2 | 78 | 34.6 | 43.4 | 43.8 | |
| LUFFY†Backbone=Qwen2.5-Math-7B, Training Protocol=Hybrid & Off-Policy Methods, Training Variant=Extended-training2026.06 | 30.7 | 25.5 | 66.2 | 86.8 | 41.2 | 55.3 | 51 | |
| LUFFYBackbone=Qwen2.5-Math-7B, Training Protocol=Hybrid & Off-Policy Methods, Training Variant=Standard2026.06 | 29.4 | 23.1 | 65.6 | 87.6 | 37.5 | 57.2 | 50.1 | |
| ReLIFTBackbone=Qwen2.5-Math-7B, Training Protocol=Hybrid & Off-Policy Methods2026.06 | 28.2 | 20.1 | 64.9 | 87.4 | 33.8 | 52.5 | 47.8 | |
| SimpleRL-ZeroBackbone=Qwen2.5-Math-7B, Training Protocol=On-Policy RLVR2026.06 | 27 | 6.8 | 54.9 | 76 | 25 | 34.7 | 37.4 | |
| SFT+RLBackbone=Qwen2.5-Math-7B, Training Protocol=Hybrid & Off-Policy Methods2026.06 | 25.8 | 23.1 | 62.7 | 87.2 | 39.7 | 50.4 | 48.2 | |
| GRPOBackbone=Qwen2.5-Math-7B, Training Protocol=On-Policy RLVR, Variation=Our replication2026.06 | 25.1 | 15.3 | 62 | 84.4 | 39.3 | 46.8 | 45.5 | |
| SFTBackbone=Qwen2.5-Math-7B, Training Protocol=Hybrid & Off-Policy Methods2026.06 | 22.2 | 22.3 | 52.8 | 82.6 | 40.8 | 43.7 | 44.1 | |
| PRIME-ZeroBackbone=Qwen2.5-Math-7B, Training Protocol=On-Policy RLVR2026.06 | 17 | 12.8 | 54 | 81.4 | 39 | 40.3 | 40.8 | |
| OpenReasoner-ZeroBackbone=Qwen2.5-Math-7B, Training Protocol=On-Policy RLVR2026.06 | 16.5 | 15 | 52.1 | 82.4 | 33.1 | 47.1 | 41 | |
| Qwen-InstructBackbone=Qwen2.5-Math-7B, Training Protocol=Instruct2026.06 | 12.5 | 10.2 | 48.5 | 80.4 | 32.7 | 41 | 37.6 | |
| Qwen-BaseBackbone=Qwen2.5-Math-7B, Training Protocol=Base2026.06 | 11.5 | 4.9 | 31.3 | 43.6 | 7.4 | 15.6 | 19.1 |