Math Word Problem Solving on GSM8K (test)
89.3AccuracyMO-CAPO
Evaluation Results
| Method | Links | |
|---|---|---|
| MO-CAPOModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 89.3 | |
| CAPOModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 87.1 | |
| GEPAModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 85.7 | |
| NSGA-II-POModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 85.2 | |
| CAPOModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 75.2 | |
| MO-CAPOModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 75.1 | |
| NSGA-II-POModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 74.3 | |
| CAPOModel=Qwen3-30B, Token Budget=7.5M2026.05 | 66.5 | |
| MO-CAPOModel=Qwen3-30B, Token Budget=7.5M2026.05 | 66.2 | |
| GEPAModel=Qwen3-30B, Token Budget=7.5M2026.05 | 65.9 | |
| NSGA-II-POModel=Qwen3-30B, Token Budget=7.5M2026.05 | 65.7 | |
| EvoPromptGAModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 58.4 | |
| GEPAModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 57.1 | |
| InitialModel=Qwen3-30B, Token Budget=7.5M2026.05 | 54 | |
| EvoPromptGAModel=Qwen3-30B, Token Budget=7.5M2026.05 | 53.7 | |
| InitialModel=GPT-OSS-120B, Token Budget=7.5M2026.05 | 49.5 | |
| InitialModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 46.3 | |
| EvoPromptGAModel=Mistral-3.2-24B, Token Budget=7.5M2026.05 | 43.9 |