Mathematical Reasoning on AIME (pass@4)
60.43Pass@4ThinkTwice
Evaluation Results
| Method | Links | |
|---|---|---|
| ThinkTwiceBackbone=Qwen3-4B, Training-free=false2026.04 | 60.43 | |
| Self-RefineBackbone=Qwen3-4B, Training-free=true2026.04 | 50.37 | |
| DAPOBackbone=Qwen3-4B, Training-free=false2026.04 | 49.86 | |
| ThinkTwiceBackbone=OLMo3-7B, Training-free=false2026.04 | 49.33 | |
| GRPOBackbone=Qwen3-4B, Training-free=false2026.04 | 48.91 | |
| Self-RefineBackbone=OLMo3-7B, Training-free=true2026.04 | 47.34 | |
| DrGRPOBackbone=Qwen3-4B, Training-free=false2026.04 | 46.98 | |
| GRPOBackbone=OLMo3-7B, Training-free=false2026.04 | 46.04 | |
| Base ModelBackbone=Qwen3-4B, Training-free=false2026.04 | 45.25 | |
| DrGRPOBackbone=OLMo3-7B, Training-free=false2026.04 | 45.24 | |
| DAPOBackbone=OLMo3-7B, Training-free=false2026.04 | 44.26 | |
| ThinkTwiceBackbone=Qwen3-4B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 44.11 | |
| DAPOBackbone=Qwen3-4B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 42.54 | |
| GRPOBackbone=OLMo3-7B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 39.38 | |
| Base ModelBackbone=OLMo3-7B, Training-free=false2026.04 | 39.31 | |
| ThinkTwiceBackbone=OLMo3-7B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 39.24 | |
| GRPOBackbone=Qwen3-4B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 39.06 | |
| ReflexionBackbone=Qwen3-4B, Training-free=true2026.04 | 38.47 | |
| ReflexionBackbone=OLMo3-7B, Training-free=true2026.04 | 37.38 | |
| DAPOBackbone=OLMo3-7B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 36.72 | |
| DrGRPOBackbone=OLMo3-7B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 36.09 | |
| DrGRPOBackbone=Qwen3-4B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 35.46 | |
| Base ModelBackbone=OLMo3-7B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 32.81 | |
| Base ModelBackbone=Qwen3-4B, Evaluation Protocol=Direct prompting, Sampling count (n)=322026.04 | 29.18 |