Prompt Optimization on Composite Suite (HotpotQA, IFBench, HoVer, PUPA, AIME, LiveBench-Math)
69HotpotQA ScoreGEPA
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| GEPAEvaluation Model=GPT-4.1 Mini, Optimization Source Model=GPT-4.1 Mini2025.07 | 69 | 52.72 | 51.67 | 94.47 | 59.33 | 64.13 | 65.22 | 12.19 | |
| GEPA+MergeEvaluation Model=GPT-4.1 Mini, Optimization Source Model=GPT-4.1 Mini2025.07 | 65.67 | 55.95 | 56.67 | 96.46 | 59.33 | 64.13 | 66.36 | 13.33 | |
| GEPA-Qwen-OptEvaluation Model=GPT-4.1 Mini, Optimization Source Model=Qwen3-8B2025.07 | 65.67 | 49.83 | 54.67 | 90.05 | 52.67 | 59.31 | 62.03 | 9 | |
| TextGradEvaluation Model=GPT-4.1 Mini2025.07 | 62.33 | 48.64 | 47.67 | 85.68 | 46.67 | 63.84 | 59.14 | 6.11 | |
| Trace (OptoPrime)Evaluation Model=GPT-4.1 Mini, Optimizer=OptoPrime2025.07 | 60.33 | 51.19 | 46 | 74.18 | 45.33 | 60.74 | 56.3 | 3.27 | |
| MIPROv2Evaluation Model=GPT-4.1 Mini, Optimization Protocol=Joint instruction and few-shot optimization2025.07 | 58 | 49.15 | 48.33 | 83.37 | 51.33 | 61.84 | 58.67 | 5.64 | |
| BaselineEvaluation Model=GPT-4.1 Mini, Optimization=None2025.07 | 38 | 47.79 | 46.33 | 78.57 | 49.33 | 58.2 | 53.03 | — | |
| MIPROv2-No-DemosEvaluation Model=GPT-4.1 Mini, Optimization Protocol=Instruction-only optimization2025.07 | 38 | 52.04 | 51.33 | 91.85 | 48.67 | 60.97 | 57.14 | 4.11 |