Math Reasoning on AIME 2025 (test)
49.06Mean AccuracyGEPA
Evaluation Results
| Method | Links | |
|---|---|---|
| GEPABackbone model=GPT-4.1-mini, Optimizer=GPT-4.12026.02 | 49.06 | |
| ETGPOBackbone model=GPT-4.1-mini, Optimizer=GPT-4.12026.02 | 49.06 | |
| MIPROv2Backbone model=GPT-4.1-mini, Optimizer=GPT-4.12026.02 | 47.66 | |
| Chain of ThoughtBackbone model=GPT-4.1-mini2026.02 | 47.08 |