Mathematical Problem Solving on AIME 25
93.3Accuracygpt-oss-20b-high
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| gpt-oss-20b-highModel=gpt-oss-20b (high)2026.02 | 93.3 | 1.74 | — | — | |
| Oracle (Perfect Knowledge)Model=ensemble2026.02 | 93.3 | 0.55 | — | — | |
| Probe RouterModel=ensemble, lambda=0.002026.02 | 93.3 | 1.57 | — | — | |
| Probe RouterModel=ensemble, lambda=0.202026.02 | 86.7 | 0.74 | — | — | |
| gpt-oss-20b-mediumModel=gpt-oss-20b (medium)2026.02 | 83.3 | 0.49 | — | — | |
| Probe RouterModel=ensemble, lambda=0.402026.02 | 80 | 0.5 | — | — | |
| Probe RouterModel=ensemble, lambda=0.602026.02 | 73.3 | 0.44 | — | — | |
| Probe RouterModel=ensemble, lambda=0.802026.02 | 73.3 | 0.43 | — | — | |
| Primitives-based MASBackbone=Qwen3-14B2026.02 | 73.3 | — | 16.6 | — | |
| Primitives-based MASModel=Qwen3-8B2026.02 | 73.3 | — | — | — | |
| Probe RouterModel=ensemble, lambda=1.002026.02 | 70 | 0.39 | — | — | |
| VotingBackbone=Qwen3-14B2026.02 | 66.7 | — | 10 | — | |
| PlanningBackbone=Qwen3-14B2026.02 | 66.7 | — | 10 | — | |
| VotingModel=Qwen3-8B2026.02 | 66.7 | — | — | — | |
| PlanningModel=Qwen3-8B2026.02 | 66.7 | — | — | — | |
| Primitives-based MASBackbone=Qwen3-4B2026.02 | 63.3 | — | 20 | — | |
| LatentMASBackbone=Qwen3-14B2026.02 | 63.3 | — | 6.6 | — | |
| ReviewBackbone=Qwen3-14B2026.02 | 63.3 | — | 6.6 | — | |
| Primitives-based MASModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 63.3 | — | — | — | |
| TextMASBackbone=Qwen3-14B2026.02 | 60 | — | 3.3 | — | |
| ReviewModel=Qwen3-8B2026.02 | 60 | — | — | — | |
| R1-Qwen-7BModel=DeepSeek-R1-Distill-Qwen-7B2026.02 | 56.7 | 0.43 | — | — | |
| SingleBackbone=Qwen3-14B2026.02 | 56.7 | — | — | — | |
| LatentMASModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 56.7 | — | — | — | |
| VotingModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 56.7 | — | — | — | |
| VotingModel=DeepSeek-R1-Distill Llama-70B2026.02 | 56.7 | — | — | — | |
| Primitives-based MASModel=DeepSeek-R1-Distill Llama-70B2026.02 | 56.7 | — | — | — | |
| AdaRASCategory=Steering2026.01 | 54.55 | — | — | — | |
| VotingBackbone=Qwen3-4B2026.02 | 53.3 | — | 10 | — | |
| TextMASModel=Qwen3-8B2026.02 | 53.3 | — | — | — | |
| LatentMASModel=Qwen3-8B2026.02 | 53.3 | — | — | — | |
| SingleModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 53.3 | — | — | — | |
| TextMASModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 53.3 | — | — | — | |
| ReviewModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 53.3 | — | — | — | |
| PlanningModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 53.3 | — | — | — | |
| TextMASModel=DeepSeek-R1-Distill Llama-70B2026.02 | 53.3 | — | — | — | |
| OpenThinker-3-1.5BCategory=Post-training2026.01 | 50 | — | — | — | |
| ProbingCategory=Steering2026.01 | 50 | — | — | — | |
| LatentMASBackbone=Qwen3-4B2026.02 | 50 | — | 6.7 | — | |
| PlanningBackbone=Qwen3-4B2026.02 | 50 | — | 6.7 | — | |
| SingleModel=DeepSeek-R1-Distill Llama-70B2026.02 | 50 | — | — | — | |
| ReviewModel=DeepSeek-R1-Distill Llama-70B2026.02 | 50 | — | — | — | |
| PlanningModel=DeepSeek-R1-Distill Llama-70B2026.02 | 50 | — | — | — | |
| ReviewBackbone=Qwen3-4B2026.02 | 46.7 | — | 3.4 | — | |
| SingleModel=Qwen3-8B2026.02 | 46.7 | — | — | — | |
| Random RoutingModel=ensemble2026.02 | 43.3 | 0.52 | — | — | |
| SingleBackbone=Qwen3-4B2026.02 | 43.3 | — | — | — | |
| TextMASBackbone=Qwen3-4B2026.02 | 43.3 | — | 0 | — | |
| CoTPrompting=Vanilla CoT, Base Model=Qwen3-1.7B2026.01 | 40.91 | — | — | — | |
| OpenReasoning-Nemotron-1.5BCategory=Post-training2026.01 | 40.91 | — | — | — | |
| gpt-oss-20b-lowModel=gpt-oss-20b (low)2026.02 | 40 | 0.07 | — | — | |
| LatentMASModel=DeepSeek-R1-Distill Llama-70B2026.02 | 40 | — | — | — | |
| TaHParam.=4B2025.11 | 30.4 | — | — | — | |
| TaH+Param.=4B2025.11 | 28.3 | — | — | — | |
| StandardParam.=4B2025.11 | 23.3 | — | — | — | |
| DeepSeek-R1-Distill-Qwen-1.5BCategory=Post-training2026.01 | 22.73 | — | — | — | |
| RoutingParam.=4B2025.11 | 22.5 | — | — | — | |
| SoftThinkParam.=4B2025.11 | 22.5 | — | — | — | |
| TaHParam.=1.7B2025.11 | 17.9 | — | — | — | |
| TaH+Param.=1.7B2025.11 | 14.6 | — | — | — | |
| ACPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 14.37 | — | — | — | |
| StandardParam.=1.7B2025.11 | 13.3 | — | — | — | |
| SoftThinkParam.=1.7B2025.11 | 12.9 | — | — | — | |
| DAPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 11.88 | — | — | — | |
| High-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 10.62 | — | — | — | |
| RoutingParam.=1.7B2025.11 | 10.2 | — | — | — | |
| ACPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 10.1 | — | — | — | |
| Math-7BModel=Qwen2.5-Math-7B-Instruct2026.02 | 10 | 0.04 | — | — | |
| AlwaysThinkParam.=1.7B2025.11 | 10 | — | — | — | |
| CISPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 10 | — | — | — | |
| Low-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 9.48 | — | — | — | |
| CISPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 8.33 | — | — | — | |
| High-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 7.81 | — | — | — | |
| DAPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 6.56 | — | — | — | |
| TaH+Param.=0.6B2025.11 | 5 | — | — | — | |
| Low-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 4.58 | — | — | — | |
| StandardParam.=0.6B2025.11 | 4.2 | — | — | — | |
| TaHParam.=0.6B2025.11 | 4.2 | — | — | — | |
| AR-LoptiRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 3.96 | — | — | — | |
| SoftThinkParam.=0.6B2025.11 | 2.5 | — | — | — | |
| AR-LoptiRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 2.08 | — | — | — | |
| AlwaysThinkParam.=0.6B2025.11 | 1.5 | — | — | — | |
| RoutingParam.=0.6B2025.11 | 1 | — | — | — | |
| Base ModelRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 0.62 | — | — | — | |
| Trinity Large Previewtuning=instruct-tuned2026.02 | — | — | — | 24.36 |