Mathematical Reasoning on HMMT
1,383Trace CountUniform
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| UniformBackbone=Qwen3-4B, Confidence-weighted=true2026.02 | 1,383 | 87 | 50.6 | |
| UniformBackbone=Qwen-Long, Confidence-weighted=false2026.02 | 1,227 | 91 | 68.8 | |
| UniformBackbone=Qwen3-30B, Confidence-weighted=false2026.02 | 1,219 | 91 | 64.7 | |
| UniformBackbone=Qwen-Long, Confidence-weighted=true2026.02 | 1,165 | 90 | 71.7 | |
| UniformBackbone=Qwen3-4B, Confidence-weighted=false2026.02 | 1,133 | 90 | 50 | |
| UniformBackbone=Qwen3-30B, Confidence-weighted=true2026.02 | 1,089 | 91 | 65.1 | |
| UniformBackbone=GPT-20B, Confidence-weighted=false2026.02 | 916 | 94 | 83.6 | |
| UniformBackbone=GPT-120B, Confidence-weighted=false2026.02 | 916 | 94 | 83.6 | |
| UniformBackbone=GPT-20B, Confidence-weighted=true2026.02 | 902 | 93 | 82.6 | |
| UniformBackbone=GPT-120B, Confidence-weighted=true2026.02 | 902 | 93 | 82.6 | |
| PETS-OfflineBackbone=Qwen3-4B, Confidence-weighted=true2026.02 | 579 | 96 | 52 | |
| PETS-OfflineBackbone=Qwen3-4B, Confidence-weighted=false2026.02 | 464 | 100 | 51.6 | |
| PETS-OfflineBackbone=Qwen3-30B, Confidence-weighted=false2026.02 | 381 | 100 | 64.7 | |
| PETS-OfflineBackbone=Qwen-Long, Confidence-weighted=true2026.02 | 371 | 97 | 73.2 | |
| PETS-OfflineBackbone=Qwen-Long, Confidence-weighted=false2026.02 | 363 | 100 | 71.7 | |
| PETS-OfflineBackbone=Qwen3-30B, Confidence-weighted=true2026.02 | 361 | 97 | 65.2 | |
| PETS-OfflineBackbone=GPT-20B, Confidence-weighted=false2026.02 | 329 | 100 | 83.3 | |
| PETS-OfflineBackbone=GPT-120B, Confidence-weighted=false2026.02 | 329 | 100 | 83.3 | |
| PETS-OfflineBackbone=GPT-20B, Confidence-weighted=true2026.02 | 324 | 99 | 83.1 | |
| PETS-OfflineBackbone=GPT-120B, Confidence-weighted=true2026.02 | 324 | 99 | 83.1 |