Mathematical Reasoning on OlympiadBench (Accuracy (avg@4), Average)
73.78Accuracy (avg@4)ThinkTwice
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ThinkTwiceBackbone=Qwen3-4B, Training-free=false2026.04 | 73.78 | — | |
| DAPOBackbone=Qwen3-4B, Training-free=false2026.04 | 72.81 | — | |
| DrGRPOBackbone=Qwen3-4B, Training-free=false2026.04 | 71.75 | — | |
| DS-R1-Distill-Qwen-7B + IC-DAPOBackbone=Qwen-7B, Zero-shot mode=true, Time/Step (s)=315.62026.03 | 71.7 | 67.8 | |
| DS-R1-Distill-Qwen-7B + CE-GPPOBackbone=Qwen-7B, Zero-shot mode=true, Time/Step (s)=292.52026.03 | 71.6 | 67.3 | |
| ThinkTwiceBackbone=OLMo3-7B, Training-free=false2026.04 | 71.38 | — | |
| DS-R1-Distill-Qwen-7B + DAPOBackbone=Qwen-7B, Zero-shot mode=true, Time/Step (s)=303.12026.03 | 69.9 | 65.3 | |
| DrGRPOBackbone=OLMo3-7B, Training-free=false2026.04 | 69.81 | — | |
| GRPOBackbone=Qwen3-4B, Training-free=false2026.04 | 69.67 | — | |
| DAPOBackbone=OLMo3-7B, Training-free=false2026.04 | 68.51 | — | |
| Self-RefineBackbone=OLMo3-7B, Training-free=true2026.04 | 68.3 | — | |
| DS-R1-Distill-Qwen-7BBackbone=Qwen-7B, Zero-shot mode=true2026.03 | 67 | 61.8 | |
| GRPOBackbone=OLMo3-7B, Training-free=false2026.04 | 66.53 | — | |
| Self-RefineBackbone=Qwen3-4B, Training-free=true2026.04 | 66.33 | — | |
| Base ModelBackbone=OLMo3-7B, Training-free=false2026.04 | 66.14 | — | |
| DS-R1-Distill-Qwen-7B + GRPOBackbone=Qwen-7B, Zero-shot mode=true, Time/Step (s)=305.62026.03 | 65.6 | 61.4 | |
| Base ModelBackbone=Qwen3-4B, Training-free=false2026.04 | 63.52 | — | |
| DS-R1-Distill-Qwen-1.5B + GSPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=437.32026.03 | 62.6 | 55.7 | |
| ReflexionBackbone=OLMo3-7B, Training-free=true2026.04 | 62.36 | — | |
| DS-R1-Distill-Qwen-1.5B + IC-DAPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=477.22026.03 | 62.1 | 56.4 | |
| DS-R1-Distill-Qwen-1.5B + CE-GPPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=464.02026.03 | 61.8 | 55.7 | |
| DS-R1-Distill-Qwen-1.5B + DAPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=459.62026.03 | 61.6 | 53.9 | |
| ReflexionBackbone=Qwen3-4B, Training-free=true2026.04 | 60.89 | — | |
| DS-R1-Distill-Qwen-1.5B + GRPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=457.42026.03 | 56.2 | 50.3 | |
| DS-R1-Distill-Qwen-1.5B + CISPOBackbone=Qwen-1.5B, Zero-shot mode=true, Time/Step (s)=466.32026.03 | 54.9 | 48.8 | |
| DS-R1-Distill-Qwen-1.5BBackbone=Qwen-1.5B, Zero-shot mode=true2026.03 | 51.8 | 46.3 |