Mathematical Reasoning on AIME24 (accuracy (%))
86.3Accuracy (AIME24)Qwen3-Base (DICE-PC)
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-Base (DICE-PC)Size=3×4B2026.06 | 86.3 | |
| OpenAI o3Size=–2026.06 | 85.8 | |
| Qwen3-235B-A22BSize=235B2026.06 | 84.9 | |
| Qwen3-Base (DICE-FT)Size=3×4B2026.06 | 84.7 | |
| Qwen3-Inst (SC@64)Size=14B2026.06 | 83.1 | |
| Qwen3 (thinking)Size=32B2026.06 | 81.4 | |
| Qwen3-A3BSize=30B2026.06 | 80.4 | |
| Qwen3-Inst (Few-shot CoT)Size=4B2026.06 | 80 | |
| OpenAI o3-miniSize=–2026.06 | 79.6 | |
| QwQSize=32B2026.06 | 79.5 | |
| Qwen3-Inst (ReAct)Size=4B2026.06 | 78.4 | |
| Qwen3-Inst (SC@64)Size=4B2026.06 | 75.4 | |
| Qwen3-Inst (ToT)Size=4B2026.06 | 75.1 | |
| Qwen3-Base Debate+Judge (FT)Size=3×8B2026.06 | 71.1 | |
| Llama 3.1-Base (DICE-PC)Size=3×8B2026.06 | 70.3 | |
| DeepSeek-R1 DistillSize=70B2026.06 | 70 | |
| Qwen3-Base Role-play (FT)Size=3×8B2026.06 | 69.9 | |
| Qwen3-Inst Debate+Judge (prompt)Size=3×4B2026.06 | 68.9 | |
| Qwen3-Base Debate (FT)Size=3×8B2026.06 | 68.7 | |
| Qwen3-Inst Role-play (prompt)Size=3×4B2026.06 | 67.3 | |
| Qwen3-Base Debate+Judge (FT)Size=3×4B2026.06 | 66.8 | |
| Qwen3-Inst Debate (prompt)Size=3×4B2026.06 | 65.8 | |
| Qwen3-Base Role-play (FT)Size=3×4B2026.06 | 65.1 | |
| Qwen3-Base Debate (FT)Size=3×4B2026.06 | 63.9 | |
| Qwen3-Inst (Zero-shot CoT)Size=4B2026.06 | 60.7 | |
| Qwen3-Base-DAPOSize=14B2026.06 | 47.7 | |
| Qwen3-Base-GRPOSize=14B2026.06 | 45.2 | |
| Qwen3-Base-DAPOSize=8B2026.06 | 41.3 | |
| Qwen3-Base-GRPOSize=8B2026.06 | 39.1 | |
| Qwen3-Base-PPOSize=8B2026.06 | 36.8 | |
| Qwen3-BaseSize=14B2026.06 | 31.7 | |
| Qwen3-BaseSize=32B2026.06 | 31 | |
| Qwen2.5-BaseSize=72B2026.06 | 18.9 | |
| GPT-4o-miniSize=–2026.06 | 8.1 |