Mathematical Reasoning on MATH 500 (Accuracy, Delta, Pct. gap closed)
96.1AccuracySCATR-WMV
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SCATR-WMVModel=GPT-OSS-20B, Calibration set=AIME2026.04 | 96.1 | — | — | |
| PRMModel=GPT-OSS-20B, Calibration set=AIME2026.04 | 95.5 | — | — | |
| SCATRModel=GPT-OSS-20B, Calibration set=AIME2026.04 | 95 | 0.4 | 12.9 | |
| LoRAModel=GPT-OSS-20B, Calibration set=AIME2026.04 | 94.8 | — | — | |
| Best Confidence-based StrategyModel=GPT-OSS-20B, Calibration set=AIME2026.04 | 94.6 | — | — | |
| SCATR-WMVModel=Qwen-30B-A3B, Calibration set=AIME2026.04 | 91.6 | — | — | |
| SCATRModel=Qwen-30B-A3B, Calibration set=AIME2026.04 | 91.3 | 6.3 | 76.8 | |
| SCATR-WMVModel=Qwen-1.7B, Calibration set=AIME2026.04 | 90.6 | — | — | |
| LoRAModel=Qwen-1.7B, Calibration set=AIME2026.04 | 88.9 | — | — | |
| PRMModel=Qwen-30B-A3B, Calibration set=AIME2026.04 | 88.9 | — | — | |
| SCATRModel=Qwen-1.7B, Calibration set=AIME2026.04 | 88.3 | 0.2 | 2.9 | |
| Best Confidence-based StrategyModel=Qwen-1.7B, Calibration set=AIME2026.04 | 88.1 | — | — | |
| PRMModel=Qwen-1.7B, Calibration set=AIME2026.04 | 87.3 | — | — | |
| Best Confidence-based StrategyModel=Qwen-30B-A3B, Calibration set=AIME2026.04 | 85 | — | — |