Mathematical Reasoning on AIME 2025 (Accuracy (%))
40.8Accuracy (%)SPIRAL
Evaluation Results
| Method | Links | |
|---|---|---|
| SPIRALBackbone=DeepSeek-Distill-Qwen-7B, Training Data=Multi-game2025.06 | 40.8 | |
| DeepSeek-Distill-Qwen-7BBackbone=DeepSeek-Distill-Qwen-7B2025.06 | 39.5 | |
| SFTBackbone=DeepSeek-Distill-Qwen-7B, Training Data=Multi-game2025.06 | 36.6 | |
| SPIRALBackbone=Qwen3-8B, Training Data=Multi-game2025.06 | 16.8 | |
| SPIRALBackbone=Qwen3-4B, Training Data=Kuhn Poker2025.06 | 15.6 | |
| SFTBackbone=Qwen3-8B, Training Data=Multi-game2025.06 | 15.6 | |
| SPIRALBackbone=Qwen3-4B, Training Data=Multi-game2025.06 | 13.3 | |
| SFTBackbone=Qwen3-4B, Training Data=Multi-game2025.06 | 11.7 | |
| Qwen3-8B-BaseBackbone=Qwen3-8B2025.06 | 11.2 | |
| SFTBackbone=Qwen3-4B, Training Data=Kuhn Poker2025.06 | 10.4 | |
| Qwen3-4B-BaseBackbone=Qwen3-4B2025.06 | 6.2 | |
| SPIRALBackbone=Octothinker-8B, Training Data=Multi-game2025.06 | 4.8 | |
| SFTBackbone=Octothinker-8B, Training Data=Multi-game2025.06 | 3.8 | |
| SPIRALBackbone=Llama-3.1-8B-Instruct, Training Data=Multi-game2025.06 | 1.8 | |
| Llama-3.1-8B-InstructBackbone=Llama-3.1-8B-Instruct2025.06 | 0.7 | |
| SFTBackbone=Llama-3.1-8B-Instruct, Training Data=Multi-game2025.06 | 0.7 | |
| Octothinker-8B-BaseBackbone=Octothinker-8B2025.06 | 0.5 |