Mathematical Reasoning on AIME 24 (# traces, Consistency, Accuracy)
1,206# TracesUniform
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| UniformBackbone=GPT-20B, Confidence-weighted=true2026.02 | 1,206 | 94 | 70.8 | |
| UniformBackbone=Qwen3-4B, Confidence-weighted=true2026.02 | 942 | 92 | 63.4 | |
| UniformBackbone=Qwen3-4B, Confidence-weighted=false2026.02 | 861 | 94 | 63 | |
| UniformBackbone=GPT-20B, Confidence-weighted=false2026.02 | 665 | 96 | 71.9 | |
| UniformBackbone=GPT-120B, Confidence-weighted=true2026.02 | 535 | 95 | 71.9 | |
| UniformBackbone=GPT-120B, Confidence-weighted=false2026.02 | 448 | 97 | 73.7 | |
| PETS-OfflineBackbone=Qwen3-4B, Confidence-weighted=true2026.02 | 369 | 96 | 66 | |
| PETS-OfflineBackbone=Qwen3-4B, Confidence-weighted=false2026.02 | 259 | 100 | 63.1 | |
| PETS-OfflineBackbone=GPT-20B, Confidence-weighted=true2026.02 | 232 | 97 | 72.6 | |
| PETS-OfflineBackbone=GPT-120B, Confidence-weighted=true2026.02 | 218 | 99 | 73.7 | |
| UniformBackbone=Qwen3-30B, Confidence-weighted=false2026.02 | 202 | 98 | 69.6 | |
| PETS-OfflineBackbone=GPT-20B, Confidence-weighted=false2026.02 | 200 | 100 | 73.3 | |
| PETS-OfflineBackbone=GPT-120B, Confidence-weighted=false2026.02 | 184 | 100 | 74.4 | |
| UniformBackbone=Qwen3-30B, Confidence-weighted=true2026.02 | 179 | 97 | 68.6 | |
| PETS-OfflineBackbone=Qwen3-30B, Confidence-weighted=false2026.02 | 135 | 100 | 70 | |
| PETS-OfflineBackbone=Qwen3-30B, Confidence-weighted=true2026.02 | 120 | 100 | 69.9 | |
| UniformBackbone=Qwen-Long, Confidence-weighted=true2026.02 | 115 | 98 | 69.7 | |
| UniformBackbone=Qwen-Long, Confidence-weighted=false2026.02 | 96 | 99 | 69.9 | |
| PETS-OfflineBackbone=Qwen-Long, Confidence-weighted=true2026.02 | 91 | 99 | 69.9 | |
| PETS-OfflineBackbone=Qwen-Long, Confidence-weighted=false2026.02 | 83 | 100 | 70 |