Math Reasoning on Olympiad
65.6Average Rate @16IRDS
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| IRDSModel=QWEN3-4B, Data Budget=20%2026.05 | 65.6 | — | — | |
| LIMRModel=QWEN3-4B, Data Budget=20%2026.05 | 61.1 | — | — | |
| PPL-MIDDLEModel=QWEN3-4B, Data Budget=20%2026.05 | 60.9 | — | — | |
| DEPOModel=QWEN3-4B, Data Budget=20%2026.05 | 60.9 | — | — | |
| IFDModel=QWEN3-4B, Data Budget=20%2026.05 | 58.3 | — | — | |
| PPL-TOPModel=QWEN3-4B, Data Budget=20%2026.05 | 57.9 | — | — | |
| KPO-clippedClipping strategy=clipped, Number of candidate solutions=162026.02 | 54.06 | 66.27 | — | |
| RANDOMModel=QWEN3-4B, Data Budget=20%2026.05 | 53.3 | — | — | |
| KPO-unclippedClipping strategy=unclipped, Number of candidate solutions=162026.02 | 52.31 | 62.55 | — | |
| IRDSModel=QWEN3-1.7B, Data Budget=20%2026.05 | 52.2 | — | — | |
| GSPONumber of candidate solutions=162026.02 | 51.37 | 63 | — | |
| TOKEN-LENGTHModel=QWEN3-4B, Data Budget=20%2026.05 | 50.2 | — | — | |
| GMPONumber of candidate solutions=162026.02 | 49.27 | 60.92 | — | |
| GRPONumber of candidate solutions=162026.02 | 48.6 | 62.25 | — | |
| LIMRModel=QWEN3-1.7B, Data Budget=20%2026.05 | 47.6 | — | — | |
| DEPOModel=QWEN3-1.7B, Data Budget=20%2026.05 | 46.9 | — | — | |
| RANDOMModel=QWEN3-1.7B, Data Budget=20%2026.05 | 44 | — | — | |
| PPL-MIDDLEModel=QWEN3-1.7B, Data Budget=20%2026.05 | 43.9 | — | — | |
| Qwen2.5-7B + DAPO-SilhouetteModel Family=Qwen Family, Strategy=DAPO-Silhouette2026.01 | 43.2 | — | — | |
| Qwen2.5-7B + DAPOModel Family=Qwen Family, Strategy=DAPO2026.01 | 42.4 | — | — | |
| PPL-TOPModel=QWEN3-1.7B, Data Budget=20%2026.05 | 42 | — | — | |
| IFDModel=QWEN3-1.7B, Data Budget=20%2026.05 | 41.9 | — | — | |
| TOKEN-LENGTHModel=QWEN3-1.7B, Data Budget=20%2026.05 | 39.5 | — | — | |
| OctoThinker-8B + DAPO-SilhouetteModel Family=OctoThinker Family, Strategy=DAPO-Silhouette2026.01 | 27.8 | — | — | |
| OctoThinker-8B + DAPOModel Family=OctoThinker Family, Strategy=DAPO2026.01 | 25.8 | — | — | |
| Qwen2.5-7BModel Family=Qwen Family2026.01 | 23.1 | — | — | |
| Llama-3.1-8B-Instruct + DAPOModel Family=Llama Family, Strategy=DAPO2026.01 | 19.4 | — | — | |
| Llama-3.1-8B-Instruct + DAPO-SilhouetteModel Family=Llama Family, Strategy=DAPO-Silhouette2026.01 | 19.4 | — | — | |
| IRDSModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 15.7 | — | — | |
| RANDOMModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 15.5 | — | — | |
| Llama-3.1-8B-InstructModel Family=Llama Family2026.01 | 15.4 | — | — | |
| DEPOModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 15.4 | — | — | |
| TOKEN-LENGTHModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 15.2 | — | — | |
| PPL-MIDDLEModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 15.1 | — | — | |
| LIMRModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 15 | — | — | |
| IFDModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 14.6 | — | — | |
| PPL-TOPModel=LLAMA-3.1-8B-INSTRUCT, Data Budget=20%2026.05 | 14.2 | — | — | |
| OctoThinker-8BModel Family=OctoThinker Family2026.01 | 13.2 | — | — |