Mathematical Reasoning on HMMT Feb 2026
100AccuracySTAR-PólyaMath
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| STAR-PólyaMathBackbone=all GPT-5.5xh2026.05 | 100 | — | — | — | — | |
| GPT-5.5Reasoning Effort=xhigh2026.05 | 97.73 | — | — | — | — | |
| GPT-5.4Reasoning Effort=xhigh2026.05 | 97.73 | — | — | — | — | |
| GPT-5.2Reasoning Effort=high2026.05 | 96.97 | — | — | — | — | |
| Claude Opus 4.6Reasoning Effort=high2026.05 | 96.21 | — | — | — | — | |
| Gemini 3.1 Pro2026.05 | 94.7 | — | — | — | — | |
| Kimi K2.6Reasoning Effort=Think2026.05 | 94.7 | — | — | — | — | |
| Claude Opus 4.7Reasoning Effort=xhigh2026.05 | 93.94 | — | — | — | — | |
| DeepSeek-v4-ProReasoning Effort=Max2026.05 | 93.94 | — | — | — | — | |
| GLM 5.12026.05 | 89.39 | — | — | — | — | |
| Kimi K2.5Reasoning Effort=Think2026.05 | 87.12 | — | — | — | — | |
| Gemini 3 Pro2026.05 | 86.36 | — | — | — | — | |
| PC-cubicModel=Nemotron3-30B, Token Budget (B)=5M2026.05 | 80.4 | — | — | — | — | |
| Standard MVModel=Nemotron3-30B, Token Budget (B)=5M2026.05 | 80.2 | — | — | — | — | |
| PC-cubicModel=Nemotron3-30B, Token Budget (B)=1M2026.05 | 78.7 | — | — | — | — | |
| PC-cubicModel=GPT-OSS-120B, Token Budget (B)=5M2026.05 | 78.6 | — | — | — | — | |
| Standard MVModel=Nemotron3-30B, Token Budget (B)=1M2026.05 | 77.7 | — | — | — | — | |
| PC-cubicModel=GPT-OSS-120B, Token Budget (B)=1M2026.05 | 77.1 | — | — | — | — | |
| Standard MVModel=GPT-OSS-120B, Token Budget (B)=5M2026.05 | 76.3 | — | — | — | — | |
| Standard MVModel=GPT-OSS-120B, Token Budget (B)=1M2026.05 | 74.5 | — | — | — | — | |
| PC-cubicModel=Nemotron3-30B, Token Budget (B)=250k2026.05 | 74.2 | — | — | — | — | |
| Standard MVModel=Nemotron3-30B, Token Budget (B)=250k2026.05 | 73.6 | — | — | — | — | |
| PC-cubicModel=GPT-OSS-120B, Token Budget (B)=250k2026.05 | 72.7 | — | — | — | — | |
| Standard MVModel=GPT-OSS-120B, Token Budget (B)=250k2026.05 | 70.8 | — | — | — | — | |
| PC-cubicModel=Ministral3-14B, Token Budget (B)=5M2026.05 | 46.1 | — | — | — | — | |
| Standard MVModel=Ministral3-14B, Token Budget (B)=5M2026.05 | 45.8 | — | — | — | — | |
| Standard MVModel=Ministral3-14B, Token Budget (B)=1M2026.05 | 44 | — | — | — | — | |
| PC-cubicModel=Ministral3-14B, Token Budget (B)=1M2026.05 | 44 | — | — | — | — | |
| PC-cubicModel=Ministral3-14B, Token Budget (B)=250k2026.05 | 41.4 | — | — | — | — | |
| Standard MVModel=Ministral3-14B, Token Budget (B)=250k2026.05 | 41.3 | — | — | — | — | |
| DelTABackbone=Qwen3-14B-Base, Fine-tuning (FT)=false2026.05 | 26.89 | — | — | — | — | |
| DAPOBackbone=Qwen3-14B-Base, Fine-tuning (FT)=false2026.05 | 25.38 | — | — | — | — | |
| DAPOBackbone=Qwen3-14B-Base, Fine-tuning (FT)=true2026.05 | 24.81 | — | — | — | — | |
| FIPOBackbone=Qwen3-14B-Base, Fine-tuning (FT)=false2026.05 | 24.43 | — | — | — | — | |
| SAPOBackbone=Qwen3-14B-Base, Fine-tuning (FT)=false2026.05 | 24.05 | — | — | — | — | |
| DelTABackbone=Qwen3-8B-Base, Fine-tuning (FT)=false2026.05 | 20.27 | — | — | — | — | |
| FIPOBackbone=Qwen3-8B-Base, Fine-tuning (FT)=false2026.05 | 17.99 | — | — | — | — | |
| SAPOBackbone=Qwen3-8B-Base, Fine-tuning (FT)=false2026.05 | 17.42 | — | — | — | — | |
| DAPOBackbone=Qwen3-8B-Base, Fine-tuning (FT)=true2026.05 | 17.05 | — | — | — | — | |
| DAPOBackbone=Qwen3-8B-Base, Fine-tuning (FT)=false2026.05 | 16.86 | — | — | — | — | |
| AC sweepModel=GPT-OSS-120B, Target accuracy (alpha)=75%2026.05 | — | 0.42 | 58.9 | 76 | 364 | |
| PC-cubicModel=GPT-OSS-120B, Target accuracy (alpha)=90%2026.05 | — | 0.46 | 58.9 | 76 | 858 | |
| PC-cubicModel=Nemotron3-30B, Target accuracy (alpha)=75%2026.05 | — | 0.59 | 70.8 | 81 | 1.6 |