Mathematical Reasoning on AIME24 (pass@1 mean/std)
53.3Pass@1 MeanReNCE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ReNCESampling strategy=avg@4, Number of repeats=42026.01 | 53.3 | 17 | |
| DAPOSampling strategy=avg@4, Number of repeats=42026.01 | 49.2 | 16.8 | |
| GRPO-1.5BZero-shot=true, Number of parameters=1.5B2025.05 | 46.7 | — | |
| GRPOSampling strategy=avg@4, Number of repeats=42026.01 | 44.2 | 18.9 | |
| Oat-Zero-7BZero-shot=true, Number of parameters=7B2025.05 | 43.3 | — | |
| Still-3-1.5B-PreviewZero-shot=true, Number of parameters=1.5B2025.05 | 39.3 | — | |
| Semi-online DPOSampling strategy=avg@4, Number of repeats=42026.01 | 37.5 | 8.9 | |
| GPG-1.5BZero-shot=true, Number of parameters=1.5B2025.05 | 33.3 | — | |
| AAPO-1.5BZero-shot=true, Number of parameters=1.5B2025.05 | 33.3 | — | |
| GPG-7BZero-shot=true, Number of parameters=7B2025.05 | 33.3 | — | |
| No trainingSampling strategy=avg@4, Number of repeats=42026.01 | 32.5 | 13.4 | |
| AAPO-7BZero-shot=true, Number of parameters=7B2025.05 | 30 | — | |
| DeepSeek-R1-Distill-Qwen-1.5BZero-shot=true, Number of parameters=1.5B2025.05 | 28.9 | — | |
| SimpleRL-Zero-7BZero-shot=true, Number of parameters=7B2025.05 | 20 | — | |
| Eurus-2-7B-PRIMEZero-shot=true, Number of parameters=7B2025.05 | 20 | — |