Mathematical Reasoning on Minerva (Acc, Fmt)
17.66AccuracyQwen3-235B-A22B-Instr.
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen3-235B-A22B-Instr.Model Scale=235B2026.03 | 17.66 | 92.34 | |
| Qwen2.5-7B ERPOModel Scale=7B, Training Method=ERPO2026.03 | 13.28 | 98.75 | |
| Qwen2.5-7B GRPOModel Scale=7B, Training Method=GRPO2026.03 | 12.5 | 98.91 | |
| DeepSeek-R1-671B-0528Model Scale=671B2026.03 | 11.41 | 34.38 | |
| Qwen2.5-3B ERPOModel Scale=3B, Training Method=ERPO2026.03 | 8.91 | 98.91 | |
| Qwen2.5-3B GRPOModel Scale=3B, Training Method=GRPO2026.03 | 7.34 | 97.03 | |
| Qwen2.5-7B SFTModel Scale=7B, Training Method=SFT2026.03 | 4.84 | 71.88 | |
| Qwen2.5-7B BaseModel Scale=7B, Training Method=Base2026.03 | 4.38 | 77.03 | |
| Qwen2.5-1.5B ERPOModel Scale=1.5B, Training Method=ERPO2026.03 | 4.22 | 97.81 | |
| Qwen2.5-1.5B GRPOModel Scale=1.5B, Training Method=GRPO2026.03 | 4.06 | 93.44 | |
| Qwen2.5-3B BaseModel Scale=3B, Training Method=Base2026.03 | 3.13 | 62.66 | |
| Qwen2.5-3B SFTModel Scale=3B, Training Method=SFT2026.03 | 2.03 | 74.69 | |
| Qwen2.5-1.5B SFTModel Scale=1.5B, Training Method=SFT2026.03 | 1.41 | 84.84 | |
| Qwen2.5-1.5B BaseModel Scale=1.5B, Training Method=Base2026.03 | 0.31 | 27.97 |