Mathematical Problem Solving on AIME 2025 (Top-1 Accuracy)
91.67Top-1 Accuracy (%)Majority Vote
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| Majority VoteModel Pool=GPT-OSS-120B2026.04 | 91.67 | — | — | — | — | |
| Self RefineModel Pool=GPT-OSS-120B2026.04 | 90 | — | — | — | — | |
| ParaManagerStrategy=Model Orchestration2026.04 | 90 | — | — | — | — | |
| Majority VoteModel Pool=Gemini-2.5-flash2026.04 | 80 | — | — | — | — | |
| BaseModel Pool=GPT-OSS-120B2026.04 | 78.75 | — | — | — | — | |
| ToolOrchestraStrategy=Model Orchestration2026.04 | 78.75 | — | — | — | — | |
| Self RefineModel Pool=Gemini-2.5-flash2026.04 | 76.67 | — | — | — | — | |
| Majority VoteModel Pool=Qwen3-235B-A22B-Instruct-25072026.04 | 76.67 | — | — | — | — | |
| Self RefineModel Pool=Qwen3-235B-A22B-Instruct-25072026.04 | 76.67 | — | — | — | — | |
| PuppeteerStrategy=Model Orchestration2026.04 | 76.67 | — | — | — | — | |
| BaseModel Pool=Qwen3-235B-A22B-Instruct-25072026.04 | 70 | — | — | — | — | |
| BaseModel Pool=Gemini-2.5-flash2026.04 | 67.08 | — | — | — | — | |
| CIKAsampling=pass@1, shots=1-shot2026.05 | 50 | — | — | — | 15 | |
| ePF w/ LaMBackbone=Qwen3-1.7B, Budget weighting=proportional weighting (w)2025.10 | 26.97 | — | — | — | — | |
| ePF w/ LaMBackbone=Qwen3-0.6B, Budget weighting=proportional weighting (w)2025.10 | 25.16 | — | — | — | — | |
| ePFBackbone=Qwen3-1.7B, Budget weighting=proportional weighting (w)2025.10 | 23.13 | — | — | — | — | |
| ePF w/ LaMBackbone=Qwen3-1.7B, Budget weighting=uniform (u)2025.10 | 22.99 | — | — | — | — | |
| ePFBackbone=Qwen3-0.6B, Budget weighting=proportional weighting (w)2025.10 | 22.06 | — | — | — | — | |
| ePFBackbone=Qwen3-1.7B, Budget weighting=uniform (u)2025.10 | 20.8 | — | — | — | — | |
| PFBackbone=Qwen3-0.6B, Budget weighting=proportional weighting (w)2025.10 | 20.25 | — | — | — | — | |
| ePF w/ LaMBackbone=Qwen3-0.6B, Budget weighting=uniform (u)2025.10 | 19.6 | — | — | — | — | |
| Best-of-NBackbone=Qwen3-1.7B, Budget weighting=proportional weighting (w)2025.10 | 19.22 | — | — | — | — | |
| PFBackbone=Qwen3-1.7B, Budget weighting=proportional weighting (w)2025.10 | 19.1 | — | — | — | — | |
| PFBackbone=Qwen3-1.7B, Budget weighting=inverse weighting (iw)2025.10 | 19.09 | — | — | — | — | |
| ePF w/ LaMBackbone=Qwen3-1.7B, Budget weighting=inverse weighting (iw)2025.10 | 19.03 | — | — | — | — | |
| PFBackbone=Qwen3-1.7B, Budget weighting=uniform (u)2025.10 | 18.6 | — | — | — | — | |
| Best-of-NBackbone=Qwen3-1.7B, Budget weighting=inverse weighting (iw)2025.10 | 18.45 | — | — | — | — | |
| Best-of-NBackbone=Qwen3-1.7B, Budget weighting=uniform (u)2025.10 | 18.4 | — | — | — | — | |
| ePFBackbone=Qwen3-0.6B, Budget weighting=uniform (u)2025.10 | 18.4 | — | — | — | — | |
| ePFBackbone=Qwen3-1.7B, Budget weighting=inverse weighting (iw)2025.10 | 18.38 | — | — | — | — | |
| Best-of-NBackbone=Qwen3-0.6B, Budget weighting=proportional weighting (w)2025.10 | 17.83 | — | — | — | — | |
| PFBackbone=Qwen3-0.6B, Budget weighting=uniform (u)2025.10 | 16.4 | — | — | — | — | |
| Best-of-NBackbone=Qwen3-0.6B, Budget weighting=uniform (u)2025.10 | 15.8 | — | — | — | — | |
| ePF w/ LaMBackbone=Qwen3-0.6B, Budget weighting=inverse weighting (iw)2025.10 | 13.55 | — | — | — | — | |
| ePFBackbone=Qwen3-0.6B, Budget weighting=inverse weighting (iw)2025.10 | 13.35 | — | — | — | — | |
| PFBackbone=Qwen3-0.6B, Budget weighting=inverse weighting (iw)2025.10 | 12.61 | — | — | — | — | |
| Best-of-NBackbone=Qwen3-0.6B, Budget weighting=inverse weighting (iw)2025.10 | 11.54 | — | — | — | — | |
| Vanilla-GRPOtraining_variant=w. SFT data2026.05 | 11.46 | — | — | — | — | |
| VHG (Soft)2026.05 | 11.46 | — | — | — | — | |
| Vanilla-GRPO2026.05 | 10.83 | — | — | — | — | |
| Base SamplingBackbone=Qwen3-1.7B, Budget weighting=uniform (u)2025.10 | 9.8 | — | — | — | — | |
| Qwen3-4B-Base2026.05 | 8.12 | — | — | — | — | |
| R-ZeroIteration=22026.05 | 7.71 | — | — | — | — | |
| R-ZeroIteration=12026.05 | 7.08 | — | — | — | — | |
| R-ZeroIteration=32026.05 | 4.17 | — | — | — | — | |
| Base SamplingBackbone=Qwen3-0.6B, Budget weighting=uniform (u)2025.10 | 2.6 | — | — | — | — | |
| Base SamplingBackbone=Qwen2.5-1.5B-In2025.10 | — | — | 3.33 | — | — | |
| Base SamplingBackbone=Qwen2.5-7B-In2025.10 | — | — | 6.66 | — | — | |
| Beam-SearchBackbone=Qwen2.5-1.5B-In2025.10 | — | 9.45 | 7.4 | 4.32 | — | |
| Beam-SearchBackbone=Qwen2.5-7B-In2025.10 | — | 14.19 | 16.2 | 16.81 | — | |
| Best-of-NBackbone=Qwen2.5-1.5B-In2025.10 | — | 5.13 | 3.6 | 2.52 | — | |
| Best-of-NBackbone=Qwen2.5-7B-In2025.10 | — | 17.41 | 15.8 | 14.9 | — | |
| ePFBackbone=Qwen2.5-1.5B-In2025.10 | — | 10.82 | 7.28 | 3.42 | — | |
| ePFBackbone=Qwen2.5-7B-In2025.10 | — | 28.83 | 25.1 | 21.96 | — | |
| PFBackbone=Qwen2.5-1.5B-In2025.10 | — | 7.32 | 4.5 | 2.87 | — | |
| PFBackbone=Qwen2.5-7B-In2025.10 | — | 21.61 | 19.8 | 17.61 | — |