General Reasoning on GPQA (pass@k)
65.7pass@1SRGen
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SRGenModel=Qwen3-32B2025.10 | 65.7 | — | |
| Self-RefineModel=Qwen3-32B2025.10 | 64.9 | — | |
| CoTModel=Qwen3-32B2025.10 | 63.5 | — | |
| SRGenModel=DS-R1-Qwen-7B2025.10 | 51.3 | — | |
| Self-RefineModel=DS-R1-Qwen-7B2025.10 | 51.2 | — | |
| CoTModel=DS-R1-Qwen-7B2025.10 | 50 | — | |
| SRGenModel=DS-R1-Llama-8B2025.10 | 48.5 | — | |
| Self-RefineModel=DS-R1-Llama-8B2025.10 | 47.9 | — | |
| CoTModel=DS-R1-Llama-8B2025.10 | 46.4 | — | |
| EVOL-RLBase Model Size=8B, Training Dataset=AIME242025.09 | 45.2 | 90 | |
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 43.9 | 92.2 | |
| EVOL-RLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 43.5 | 88.1 | |
| TTRLBase Model Size=8B, Training Dataset=MATH-5002025.09 | 43.5 | 84 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 38.8 | 89.1 | |
| TTRLBase Model Size=8B, Training Dataset=AIME242025.09 | 38.3 | 74.7 | |
| TTRLBase Model Size=8B, Training Dataset=MATH-TRAIN2025.09 | 38.1 | 77.1 | |
| EVOL-RLBase Model Size=4B, Training Dataset=AIME242025.09 | 38 | 87.8 | |
| EVOL-RLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 37.2 | 88.7 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-TRAIN2025.09 | 36.5 | 81.4 | |
| TTRLBase Model Size=4B, Training Dataset=MATH-5002025.09 | 36.2 | 75.9 | |
| TTRLBase Model Size=4B, Training Dataset=AIME242025.09 | 35.1 | 73.5 | |
| Qwen3-8B-BaseBase Model Size=8B, Training Dataset=-2025.09 | 34.9 | 88 | |
| Qwen3-4B-BaseBase Model Size=4B, Training Dataset=-2025.09 | 34.4 | 85.6 | |
| SRGenModel=Qwen2.5-Math-7B2025.10 | 33.8 | — | |
| CoTModel=Qwen2.5-Math-7B2025.10 | 31.8 | — | |
| Self-RefineModel=Qwen2.5-Math-7B2025.10 | 31.5 | — | |
| SCRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-Math-7B2026.03 | 26 | — | |
| SCRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-3B2026.03 | 25.7 | — | |
| TTRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-Math-7B2026.03 | 25.5 | — | |
| TTRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-Math-7B2026.03 | 25.5 | — | |
| SCRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-Math-7B2026.03 | 25.4 | — | |
| TTRLCandidate responses=32, Training samples=16, Backbone=Qwen2.5-3B2026.03 | 25 | — | |
| SCRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-3B2026.03 | 24.5 | — | |
| TTRLCandidate responses=64, Training samples=32, Backbone=Qwen2.5-3B2026.03 | 23.5 | — | |
| Qwen2.5-Math-7BCandidate responses=32, Training samples=16, Backbone=Qwen2.5-Math-7B2026.03 | 23 | — | |
| Qwen2.5-Math-7BCandidate responses=64, Training samples=32, Backbone=Qwen2.5-Math-7B2026.03 | 23 | — | |
| Qwen2.5-3BCandidate responses=32, Training samples=16, Backbone=Qwen2.5-3B2026.03 | 21.6 | — | |
| Qwen2.5-3BCandidate responses=64, Training samples=32, Backbone=Qwen2.5-3B2026.03 | 21.6 | — |