Reasoning on AIME 25 (Accuracy, Consistency, # traces)
681Trace CountPETS-On. (conf)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| PETS-On. (conf)LLM=Qwen-Long, Confidence-Weighted=true2026.02 | 681 | 96 | 85.7 | |
| PETS-On. (conf)LLM=Qwen3-30B, Confidence-Weighted=true2026.02 | 535 | 97 | 82.5 | |
| PETS-On.LLM=Qwen3-30B, Confidence-Weighted=false2026.02 | 504 | 100 | 83.5 | |
| Uniform (conf)LLM=Qwen-Long, Confidence-Weighted=true2026.02 | 495 | 93 | 83.5 | |
| PETS-On. (conf)LLM=GPT-120B, Confidence-Weighted=true2026.02 | 493 | 98 | 92.3 | |
| Uniform (conf)LLM=Qwen3-30B, Confidence-Weighted=true2026.02 | 486 | 94 | 81.2 | |
| Uniform (conf)LLM=GPT-120B, Confidence-Weighted=true2026.02 | 459 | 94 | 89.8 | |
| PETS-On.LLM=GPT-120B, Confidence-Weighted=false2026.02 | 454 | 100 | 91.7 | |
| Uniform (conf)LLM=Qwen3-4B, Confidence-Weighted=true2026.02 | 452 | 92 | 76.3 | |
| UniformLLM=GPT-120B, Confidence-Weighted=false2026.02 | 416 | 95 | 89.2 | |
| UniformLLM=Qwen3-30B, Confidence-Weighted=false2026.02 | 415 | 95 | 81 | |
| Uniform (conf)LLM=GPT-20B, Confidence-Weighted=true2026.02 | 349 | 93 | 85.2 | |
| PETS-On. (conf)LLM=GPT-20B, Confidence-Weighted=true2026.02 | 330 | 96 | 84.8 | |
| UniformLLM=Qwen3-4B, Confidence-Weighted=false2026.02 | 290 | 95 | 74.8 | |
| PETS-On. (conf)LLM=Qwen3-4B, Confidence-Weighted=true2026.02 | 287 | 95 | 76.3 | |
| UniformLLM=Qwen-Long, Confidence-Weighted=false2026.02 | 229 | 95 | 84.7 | |
| UniformLLM=GPT-20B, Confidence-Weighted=false2026.02 | 221 | 96 | 86 | |
| PETS-On.LLM=Qwen-Long, Confidence-Weighted=false2026.02 | 218 | 100 | 85 | |
| PETS-On.LLM=GPT-20B, Confidence-Weighted=false2026.02 | 195 | 100 | 85 | |
| PETS-On.LLM=Qwen3-4B, Confidence-Weighted=false2026.02 | 194 | 100 | 75 |