Mathematical Reasoning on AIME 25 (Acc, Fmt)
16.88AccuracyQwen3-235B-A22B-Instr.
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-235B-A22B-Instr.Model Scale=235B2026.03 | 16.88 | 20.21 | |
| DeepSeek-R1-671B-0528Model Scale=671B2026.03 | 11.04 | 11.04 | |
| Qwen2.5-7B ERPOModel Scale=7B, Training Method=ERPO2026.03 | 7.08 | 96.25 | |
| Qwen2.5-7B GRPOModel Scale=7B, Training Method=GRPO2026.03 | 6.46 | 94.17 | |
| Qwen2.5-3B GRPOModel Scale=3B, Training Method=GRPO2026.03 | 3.33 | 93.96 | |
| Qwen2.5-3B ERPOModel Scale=3B, Training Method=ERPO2026.03 | 2.92 | 97.92 | |
| Qwen2.5-1.5B GRPOModel Scale=1.5B, Training Method=GRPO2026.03 | 2.08 | 94.17 | |
| Qwen2.5-1.5B ERPOModel Scale=1.5B, Training Method=ERPO2026.03 | 2.08 | 94.17 | |
| Qwen2.5-3B BaseModel Scale=3B, Training Method=Base2026.03 | 1.46 | 78.96 | |
| Qwen2.5-7B SFTModel Scale=7B, Training Method=SFT2026.03 | 1.46 | 94.79 | |
| Qwen2.5-7B BaseModel Scale=7B, Training Method=Base2026.03 | 1.25 | 83.54 | |
| Qwen2.5-3B SFTModel Scale=3B, Training Method=SFT2026.03 | 0.83 | 95.63 | |
| Qwen2.5-1.5B SFTModel Scale=1.5B, Training Method=SFT2026.03 | 0.42 | 93.13 | |
| Qwen2.5-1.5B BaseModel Scale=1.5B, Training Method=Base2026.03 | 0 | 26.67 |