Mathematical Reasoning on AIME 24 (Acc, Fmt)
24.58Accuracy (AIME 24)Qwen3-235B-A22B-Instr.
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-235B-A22B-Instr.Model Scale=235B2026.03 | 24.58 | 29.58 | |
| DeepSeek-R1-671B-0528Model Scale=671B2026.03 | 13.54 | 13.54 | |
| Qwen2.5-7B ERPOModel Scale=7B, Training Method=ERPO2026.03 | 12.92 | 94.79 | |
| Qwen2.5-7B GRPOModel Scale=7B, Training Method=GRPO2026.03 | 11.25 | 93.75 | |
| Qwen2.5-3B ERPOModel Scale=3B, Training Method=ERPO2026.03 | 7.08 | 92.5 | |
| Qwen2.5-3B GRPOModel Scale=3B, Training Method=GRPO2026.03 | 5.21 | 87.71 | |
| Qwen2.5-1.5B ERPOModel Scale=1.5B, Training Method=ERPO2026.03 | 3.75 | 90 | |
| Qwen2.5-1.5B GRPOModel Scale=1.5B, Training Method=GRPO2026.03 | 3.54 | 87.08 | |
| Qwen2.5-7B BaseModel Scale=7B, Training Method=Base2026.03 | 3.54 | 82.5 | |
| Qwen2.5-3B BaseModel Scale=3B, Training Method=Base2026.03 | 2.08 | 75.83 | |
| Qwen2.5-7B SFTModel Scale=7B, Training Method=SFT2026.03 | 1.46 | 88.75 | |
| Qwen2.5-1.5B SFTModel Scale=1.5B, Training Method=SFT2026.03 | 0.83 | 95.42 | |
| Qwen2.5-3B SFTModel Scale=3B, Training Method=SFT2026.03 | 0.83 | 95.42 | |
| Qwen2.5-1.5B BaseModel Scale=1.5B, Training Method=Base2026.03 | 0.21 | 28.33 |