Mathematical Reasoning on NuminaMath
60.9AccuracyQwen2.5-Math-72B-Instruct
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-Math-72B-InstructEvaluating Model=Qwen2.5-Math-72B-Instruct2025.03 | 60.9 | — | |
| SA-GRPOBase Model=Qwen3-4B, alpha=0.22025.09 | 57.7 | 1,358 | |
| GRPOBase Model=Qwen3-4B2025.09 | 53.79 | 1,485 | |
| GRPO-O1Base Model=Qwen3-4B, alpha=0.052025.09 | 51.06 | 866 | |
| PPOBase Model=Qwen3-4B2025.09 | 50.8 | 1,995 | |
| GRPO-ERBase Model=Qwen3-4B, alpha=0.052025.09 | 50.47 | 854 | |
| SA-PPOBase Model=Qwen3-4B2025.09 | 49.09 | 1,133 | |
| GRPO-ERBackbone=Gemma3-4B2025.09 | 41.94 | 1,817 | |
| GRPOBackbone=Gemma3-4B2025.09 | 41.9 | 2,012 | |
| GRPO-O1Backbone=Gemma3-4B2025.09 | 41.68 | 1,435 | |
| SA-GRPOBackbone=Gemma3-4B2025.09 | 40.48 | 1,920 | |
| Qwen3-4BBase Model=Qwen3-4B2025.09 | 38.8 | 1,142 | |
| SA-GRPOBase Model=Qwen3-1.7B, alpha=0.22025.09 | 36.03 | 841 | |
| Gemma3-4BBackbone=Gemma3-4B, Strategy=Base2025.09 | 35.81 | 1,370 | |
| GRPO-ERBase Model=Qwen3-1.7B, alpha=0.052025.09 | 34.35 | 980 | |
| GRPOBase Model=Qwen3-1.7B2025.09 | 33.44 | 1,091 | |
| GRPO-O1Base Model=Qwen3-1.7B, alpha=0.052025.09 | 33.15 | 775 | |
| SA-PPOBase Model=Qwen3-1.7B2025.09 | 32.05 | 866 | |
| PPOBase Model=Qwen3-1.7B2025.09 | 27.02 | 1,358 | |
| Qwen3-1.7BBase Model=Qwen3-1.7B2025.09 | 24.58 | 1,242 | |
| SA-PPOBase Model=Phi-3.5-mini2025.09 | 17.43 | 586 | |
| SA-GRPOBase Model=Gemma3-1B, alpha=0.22025.09 | 16.7 | 1,302 | |
| GRPOBase Model=Gemma3-1B2025.09 | 16.59 | 2,264 | |
| GRPO-ERBase Model=Gemma3-1B, alpha=0.052025.09 | 16.41 | 1,545 | |
| GRPOBase Model=Phi-3.5-mini2025.09 | 16.37 | 582 | |
| GRPO-O1Base Model=Gemma3-1B, alpha=0.052025.09 | 16.16 | 1,871 | |
| SA-GRPOBase Model=Phi-3.5-mini, alpha=0.22025.09 | 16.08 | 455 | |
| PPOBase Model=Gemma3-1B2025.09 | 15.57 | 1,904 | |
| SA-PPOBase Model=Gemma3-1B2025.09 | 14.22 | 1,523 | |
| GRPO-O1Base Model=Phi-3.5-mini, alpha=0.052025.09 | 14.08 | 509 | |
| GRPO-ERBase Model=Phi-3.5-mini, alpha=0.052025.09 | 12.55 | 511 | |
| Gemma3-1BBase Model=Gemma3-1B2025.09 | 12.4 | 1,414 | |
| Phi-3.5-miniBase Model=Phi-3.5-mini2025.09 | 11.56 | 1,492 | |
| PPOBase Model=Phi-3.5-mini2025.09 | 11.45 | 1,707 | |
| GRPO-O1Backbone=Qwen2-2B-VL2025.09 | 9.99 | 22 | |
| SA-GRPOBackbone=Qwen2-2B-VL2025.09 | 9.52 | 56 | |
| GRPOBackbone=Qwen2-2B-VL2025.09 | 9.19 | 512 | |
| GRPO-ERBackbone=Qwen2-2B-VL2025.09 | 8.32 | 330 | |
| Qwen2-2B-VLBackbone=Qwen2-2B-VL, Strategy=Base2025.09 | 3.65 | 2,411 | |
| DeepSeek-R1-Distill-Qwen-7BEvaluating Model=DeepSeek-R1-Distill-Qwen-7B2025.03 | — | 3,039 |