Mathematical Reasoning on Minerva (Accuracy %)
53.3Accuracy (%)WIST
Evaluation Results
| Method | Links | |
|---|---|---|
| WISTBackbone=Qwen3-8B-Base2026.03 | 53.3 | |
| SPICEBackbone=Qwen3-8B-Base2026.03 | 51.5 | |
| SPIRALBackbone=DeepSeek-Distill-Qwen-7B, Training Data=Multi-game2025.06 | 51.1 | |
| R-ZeroBackbone=Qwen3-8B-Base2026.03 | 48.5 | |
| DeepSeek-Distill-Qwen-7BBackbone=DeepSeek-Distill-Qwen-7B2025.06 | 48.2 | |
| SFTBackbone=DeepSeek-Distill-Qwen-7B, Training Data=Multi-game2025.06 | 48.2 | |
| SPICEBackbone=Qwen3-4B-Base2026.03 | 47.8 | |
| WISTBackbone=Qwen3-4B-Base2026.03 | 47.8 | |
| SPIRALBackbone=Qwen3-8B, Training Data=Multi-game2025.06 | 46.3 | |
| R-ZeroBackbone=Qwen3-4B-Base2026.03 | 44.1 | |
| STABLE-OPDBackbone=Qwen2.5-Math-7B, Teacher=OpenThinkerV32026.04 | 43.4 | |
| Base ModelBackbone=Qwen3-8B-Base2026.03 | 43 | |
| SPIRALBackbone=Qwen3-4B, Training Data=Multi-game2025.06 | 42.6 | |
| SPIRALBackbone=Qwen3-4B, Training Data=Kuhn Poker2025.06 | 42.4 | |
| SFTBackbone=Qwen3-8B, Training Data=Multi-game2025.06 | 40.8 | |
| SFTBackbone=Qwen2.5-Math-7B2026.04 | 40.8 | |
| SFTBackbone=Qwen3-4B, Training Data=Multi-game2025.06 | 40.1 | |
| GRPOBackbone=Qwen2.5-Math-7B2026.04 | 39.3 | |
| PRIME-ZEROBackbone=Qwen2.5-Math-7B2026.04 | 39 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B2025.06 | 38.2 | |
| OPDBackbone=Qwen2.5-Math-7B, Teacher=OpenThinkerV32026.04 | 37.9 | |
| SFTBackbone=Qwen3-4B, Training Data=Kuhn Poker2025.06 | 36.8 | |
| WISTBackbone=OctoThinker-8B-Hybrid-Base2026.03 | 36.4 | |
| Base ModelBackbone=Qwen3-4B-Base2026.03 | 35.7 | |
| H2OModel=Qwen3-8B, Budget=32002026.03 | 35.29 | |
| Qwen3-VL-8B + SynRLModel Scale=8B, SynRL Training=true2026.03 | 35.2 | |
| OAT-ZEROBackbone=Qwen2.5-Math-7B2026.04 | 34.6 | |
| Qwen3-VL-8BModel Scale=8B, SynRL Training=false2026.03 | 34.4 | |
| VATPModel=Qwen3-8B, Budget=32002026.03 | 34.19 | |
| LongFlowModel=Qwen3-8B, Budget=32002026.03 | 34.19 | |
| VanillaModel=Qwen3-8B, Budget=24002026.03 | 33.46 | |
| VanillaModel=Qwen3-8B, Budget=32002026.03 | 33.46 | |
| R-KVModel=Qwen3-8B, Budget=32002026.03 | 33.46 | |
| OPENREASONER-ZEROBackbone=Qwen2.5-Math-7B2026.04 | 33.1 | |
| Qwen3-VL-4B + SynRLModel Scale=4B, SynRL Training=true2026.03 | 32.8 | |
| R-KVModel=Qwen3-8B, Budget=24002026.03 | 32.72 | |
| QWEN2.5-MATH-7B-INSTRUCTBackbone=Qwen2.5-Math-7B2026.04 | 32.7 | |
| Qwen3-VL-4BModel Scale=4B, SynRL Training=false2026.03 | 32.5 | |
| H2OModel=Qwen3-8B, Budget=24002026.03 | 32.35 | |
| SPIRALBackbone=Octothinker-8B, Training Data=Multi-game2025.06 | 32 | |
| VATPModel=Qwen3-8B, Budget=24002026.03 | 31.99 | |
| R-ZeroBackbone=OctoThinker-8B-Hybrid-Base2026.03 | 31.5 | |
| LongFlowModel=Qwen3-8B, Budget=24002026.03 | 31.25 | |
| SPICEBackbone=OctoThinker-8B-Hybrid-Base2026.03 | 30.2 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B2025.06 | 29.4 | |
| Base ModelBackbone=OctoThinker-8B-Hybrid-Base2026.03 | 26.2 | |
| Octothinker-8B-BaseBackbone=Octothinker-8B2025.06 | 25.7 | |
| SIMPLERL-ZEROBackbone=Qwen2.5-Math-7B2026.04 | 25 | |
| SPIRALBackbone=Llama-3.1-8B-Instruct, Training Data=Multi-game2025.06 | 24.6 | |
| SFTBackbone=Octothinker-8B, Training Data=Multi-game2025.06 | 23.8 | |
| Llama-3.1-8B-InstructBackbone=Llama-3.1-8B-Instruct2025.06 | 22.8 | |
| WISTBackbone=OctoThinker-3B-Hybrid-Base2026.03 | 22.7 | |
| SPICEBackbone=OctoThinker-3B-Hybrid-Base2026.03 | 22.4 | |
| R-ZeroBackbone=OctoThinker-3B-Hybrid-Base2026.03 | 21.8 | |
| SFTBackbone=Llama-3.1-8B-Instruct, Training Data=Multi-game2025.06 | 21.7 | |
| H2OModel=DeepSeek-R1-Distill-Llama-8B, Budget=32002026.03 | 21.32 | |
| VanillaModel=DeepSeek-R1-Distill-Llama-8B, Budget=24002026.03 | 20.59 | |
| VATPModel=DeepSeek-R1-Distill-Llama-8B, Budget=24002026.03 | 20.59 | |
| VanillaModel=DeepSeek-R1-Distill-Llama-8B, Budget=32002026.03 | 20.59 | |
| R-KVModel=DeepSeek-R1-Distill-Llama-8B, Budget=24002026.03 | 20.22 | |
| LongFlowModel=DeepSeek-R1-Distill-Llama-8B, Budget=24002026.03 | 20.22 | |
| LongFlowModel=DeepSeek-R1-Distill-Llama-8B, Budget=32002026.03 | 20.22 | |
| R-KVModel=DeepSeek-R1-Distill-Llama-8B, Budget=32002026.03 | 19.49 | |
| H2OModel=DeepSeek-R1-Distill-Llama-8B, Budget=24002026.03 | 19.12 | |
| VATPModel=DeepSeek-R1-Distill-Llama-8B, Budget=32002026.03 | 19.12 | |
| Base ModelBackbone=OctoThinker-3B-Hybrid-Base2026.03 | 18.5 | |
| QWEN2.5-MATH-7BBackbone=Qwen2.5-Math-7B2026.04 | 7.4 |