Out-of-Distribution Reasoning on MMLU-S, GPQA, ARC, and BBH (test)
45.9GPQADaGRPO (w/o Off-policy)
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| DaGRPO (w/o Off-policy)Off-policy=false2025.12 | 45.9 | — | — | — | 59.9 | 81.3 | 52.4 | |
| DaGRPOOff-policy=true2025.12 | 40.9 | — | — | — | 59 | 83.1 | 53 | |
| GRPOMode=On-policy RL2025.12 | 40.4 | — | — | — | 57.2 | 82.2 | 49.2 | |
| LUFFYApproach=Hybrid2025.12 | 38.8 | — | — | — | 57.6 | 81.2 | 52.8 | |
| SFT -> GRPOPipeline=Hybrid2025.12 | 30.8 | — | — | — | 49.3 | 67.7 | 40.5 | |
| SFTBase Model=Mistral-7B, Training Dataset=MathInstruct2024.03 | 29.8 | 48.1 | 70.6 | 47.8 | 49.1 | — | — | |
| OpenReasoner-ZeroApproach=RLVR2025.12 | 29.8 | — | — | — | 51.6 | 66.2 | 58.7 | |
| MFTBase Model=Mistral-7B, Training Dataset=MetaMathQA2024.03 | 27.3 | 50.7 | 72.8 | 49.6 | 50.1 | — | — | |
| SFTBase Model=Mistral-7B, Training Dataset=MetaMathQA2024.03 | 25.7 | 53.6 | 76.2 | 50.3 | 51.4 | — | — | |
| MFTBase Model=Mistral-7B, Training Dataset=MathInstruct2024.03 | 25.7 | 52.8 | 75.3 | 52.5 | 51.6 | — | — | |
| SFTBase Model=Llama2-7B, Training Dataset=MetaMathQA2024.03 | 25.2 | 33.6 | 48.9 | 32.1 | 35 | — | — | |
| MFTBase Model=Llama2-7B, Training Dataset=MathInstruct2024.03 | 25.2 | 40.6 | 60 | 37.8 | 40.9 | — | — | |
| Qwen2.5-Math-InstructVersion=Instruct2025.12 | 24.7 | — | — | — | 43 | 70.3 | 34.1 | |
| SFTMode=Fine-tuned2025.12 | 24.7 | — | — | — | 47.5 | 75.2 | 42.7 | |
| Oat-ZeroApproach=RLVR2025.12 | 23.7 | — | — | — | 45.2 | 70.1 | 41.7 | |
| MFTBase Model=Llama2-7B, Training Dataset=MetaMathQA2024.03 | 23.2 | 33.4 | 51.1 | 33.4 | 35.3 | — | — | |
| SimpleRL-ZeroApproach=RLVR2025.12 | 23.2 | — | — | — | 29.3 | 30.2 | 34.5 | |
| SFTBase Model=Llama2-7B, Training Dataset=MathInstruct2024.03 | 22.2 | 38.9 | 60.6 | 38.1 | 40 | — | — | |
| PRIME-ZeroApproach=RLVR2025.12 | 18.2 | — | — | — | 41.4 | 73.3 | 32.7 | |
| Qwen2.5-MathVersion=Base2025.12 | 12.6 | — | — | — | 12.3 | 10 | 14.4 |