Math Problem Solving on AIME 24
90AccuracyBERT-Judge
Evaluation Results
| Method | Links | |
|---|---|---|
| BERT-Judgeclean_name=BERT-as-a-Judge2026.04 | 90 | |
| Regex2026.04 | 87.8 | |
| LLM-Judgebackbone=Qwen-3 0.6B2026.04 | 77.9 | |
| Primitives-based MASModel=Qwen3-8B2026.02 | 76.7 | |
| Primitives-based MASModel=DeepSeek-R1-Distill Llama-70B2026.02 | 76.7 | |
| SingleModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 73.3 | |
| TextMASModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 73.3 | |
| LatentMASModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 73.3 | |
| Primitives-based MASModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 73.3 | |
| VotingModel=DeepSeek-R1-Distill Llama-70B2026.02 | 73.3 | |
| VotingModel=Qwen3-8B2026.02 | 70 | |
| ReviewModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 70 | |
| VotingModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 70 | |
| SingleModel=DeepSeek-R1-Distill Llama-70B2026.02 | 70 | |
| TextMASModel=DeepSeek-R1-Distill Llama-70B2026.02 | 70 | |
| ReviewModel=DeepSeek-R1-Distill Llama-70B2026.02 | 70 | |
| PlanningModel=DeepSeek-R1-Distill Qwen-32B2026.02 | 66.7 | |
| ReviewModel=Qwen3-8B2026.02 | 63.3 | |
| PlanningModel=Qwen3-8B2026.02 | 63.3 | |
| PlanningModel=DeepSeek-R1-Distill Llama-70B2026.02 | 63.3 | |
| LatentMASModel=Qwen3-8B2026.02 | 56.7 | |
| TextMASModel=Qwen3-8B2026.02 | 53.3 | |
| SingleModel=Qwen3-8B2026.02 | 50 | |
| LatentMASModel=DeepSeek-R1-Distill Llama-70B2026.02 | 43.3 | |
| DAPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 19.69 | |
| CISPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 18.65 | |
| DAPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 18.02 | |
| ACPORegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 16.77 | |
| ACPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 16.35 | |
| Low-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 16.04 | |
| AR-LoptiRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 15.21 | |
| High-EntropyRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 14.37 | |
| High-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 14.06 | |
| CISPORegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 13.44 | |
| Low-EntropyRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 11.15 | |
| AR-LoptiRegime=OffP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 8.75 | |
| Base ModelRegime=N-OnP., Backbone=Qwen2.5-7B, Training Dataset=ORZ-57K, Sampling Strategy=avg@322026.06 | 0.83 |