Mathematical Reasoning on AIME 25 (# traces, Consistency, Accuracy)
911Trace CountUniform
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| UniformBackbone=GPT-120B, Confidence-weighted=true2026.02 | 911 | 94 | 91.9 | |
| UniformBackbone=Qwen3-30B, Confidence-weighted=true2026.02 | 763 | 93 | 85.6 | |
| UniformBackbone=Qwen-Long, Confidence-weighted=true2026.02 | 752 | 94 | 88.9 | |
| UniformBackbone=GPT-120B, Confidence-weighted=false2026.02 | 681 | 95 | 91.3 | |
| UniformBackbone=GPT-20B, Confidence-weighted=true2026.02 | 618 | 94 | 89 | |
| UniformBackbone=Qwen3-4B, Confidence-weighted=true2026.02 | 610 | 91 | 83.3 | |
| UniformBackbone=Qwen3-30B, Confidence-weighted=false2026.02 | 545 | 96 | 86.1 | |
| UniformBackbone=Qwen3-4B, Confidence-weighted=false2026.02 | 470 | 94 | 82.1 | |
| UniformBackbone=GPT-20B, Confidence-weighted=false2026.02 | 410 | 95 | 90.2 | |
| UniformBackbone=Qwen-Long, Confidence-weighted=false2026.02 | 288 | 97 | 89.3 | |
| PETS-OfflineBackbone=Qwen3-4B, Confidence-weighted=true2026.02 | 257 | 98 | 84 | |
| PETS-OfflineBackbone=GPT-20B, Confidence-weighted=true2026.02 | 251 | 97 | 89.7 | |
| PETS-OfflineBackbone=Qwen3-30B, Confidence-weighted=true2026.02 | 223 | 97 | 86.7 | |
| PETS-OfflineBackbone=Qwen3-4B, Confidence-weighted=false2026.02 | 212 | 100 | 83.3 | |
| PETS-OfflineBackbone=GPT-120B, Confidence-weighted=false2026.02 | 212 | 100 | 93.9 | |
| PETS-OfflineBackbone=GPT-120B, Confidence-weighted=true2026.02 | 211 | 98 | 93.3 | |
| PETS-OfflineBackbone=Qwen-Long, Confidence-weighted=true2026.02 | 203 | 97 | 90.4 | |
| PETS-OfflineBackbone=Qwen3-30B, Confidence-weighted=false2026.02 | 190 | 100 | 88.6 | |
| PETS-OfflineBackbone=GPT-20B, Confidence-weighted=false2026.02 | 181 | 100 | 90 | |
| PETS-OfflineBackbone=Qwen-Long, Confidence-weighted=false2026.02 | 152 | 100 | 90 |