Mathematical Reasoning on Math latest (test)
20AIME2025WMSS
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| WMSSBase Model=Qwen3-4B-Base, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 20 | 71.3 | 50 | 67.6 | 88.5 | 96.2 | 90.3 | 69.1 | |
| WMSSBase Model=Qwen3-8B-Base, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 20 | 75.4 | 52.5 | 77.3 | 92.5 | 97.8 | 94 | 72.9 | |
| NEFTuneBase Model=Qwen3-4B-Base, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 16.7 | 68.2 | 43.3 | 58.9 | 86.7 | 93.8 | 87.7 | 65 | |
| SFTBase Model=Qwen3-8B-Base, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 15.6 | 72.1 | 45 | 63 | 87.5 | 95.1 | 88.6 | 66.7 | |
| NEFTuneBase Model=Qwen3-8B-Base, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 15.6 | 73.7 | 40 | 71.3 | 90.3 | 97.3 | 91.5 | 68.5 | |
| SFTBase Model=Qwen3-4B-Base, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 12.2 | 66.1 | 47.7 | 61.8 | 83.9 | 91.3 | 85.5 | 64.1 | |
| UNDIALBase Model=Qwen3-4B-Base, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 12.2 | 63.1 | 40 | 55.1 | 82.9 | 90.9 | 84.1 | 61.2 | |
| UNDIALBase Model=Qwen3-8B-Base, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 10 | 71.5 | 48.3 | 66.9 | 89.9 | 96.4 | 91.2 | 67.7 | |
| WMSSBase Model=Qwen2.5-3B, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 5.5 | 52 | 22.5 | 53.8 | 80.9 | 92.6 | 86 | 56.2 | |
| UNDIALBase Model=Qwen2.5-3B, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 4.4 | 50.7 | 18.3 | 49.3 | 77.4 | 91.3 | 83.2 | 53.5 | |
| SFTBase Model=Qwen2.5-3B, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 2.2 | 46.9 | 21.6 | 51.3 | 76.6 | 91.6 | 84.4 | 53.5 | |
| NEFTuneBase Model=Qwen2.5-3B, Fine-tuning Epochs=2, Runs=3 (averaged)2026.02 | 2.2 | 51.3 | 22.5 | 47.1 | 78.1 | 90.3 | 84.7 | 53.7 |