Mathematical Reasoning on AIME24 (avg@256)
18.1Average Score (avg@256)Qwen2.5-7B + DAPO-Silhouette
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-7B + DAPO-SilhouetteModel Family=Qwen Family, Strategy=DAPO-Silhouette2026.01 | 18.1 | |
| Qwen2.5-7B + DAPOModel Family=Qwen Family, Strategy=DAPO2026.01 | 12.2 | |
| OctoThinker-8B + DAPO-SilhouetteModel Family=OctoThinker Family, Strategy=DAPO-Silhouette2026.01 | 8.2 | |
| Llama-3.1-8B-Instruct + DAPO-SilhouetteModel Family=Llama Family, Strategy=DAPO-Silhouette2026.01 | 7.9 | |
| Llama-3.1-8B-Instruct + DAPOModel Family=Llama Family, Strategy=DAPO2026.01 | 6.1 | |
| Qwen2.5-7BModel Family=Qwen Family2026.01 | 5.5 | |
| OctoThinker-8B + DAPOModel Family=OctoThinker Family, Strategy=DAPO2026.01 | 4.9 | |
| Llama-3.1-8B-InstructModel Family=Llama Family2026.01 | 3.7 | |
| OctoThinker-8BModel Family=OctoThinker Family2026.01 | 1.5 |