Instruction Following on IFBench (test)
55.95ScoreGEPA+Merge
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GEPA+MergeModel=GPT-4.1 mini2026.04 | 55.95 | — | — | — | |
| GEPAModel=GPT-4.1 mini2026.04 | 52.72 | — | — | — | |
| FLOWBOTModel=GPT-4.1 mini2026.04 | 52.51 | — | — | — | |
| MetaHarnessWall (minutes)=1262026.05 | 52.3 | — | — | — | |
| CROWall (minutes)=822026.05 | 51.3 | — | — | — | |
| TraceModel=GPT-4.1 mini2026.04 | 51.19 | — | — | — | |
| GEPAWall (minutes)=502026.05 | 50.1 | — | — | — | |
| MIPROv2Model=GPT-4.1 mini2026.04 | 49.15 | — | — | — | |
| TextGradModel=GPT-4.1 mini2026.04 | 48.64 | — | — | — | |
| BaselineModel=GPT-4.1 mini2026.04 | 47.79 | — | — | — | |
| Baseline2026.05 | 42.4 | — | — | — | |
| TextGrad-MLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash, Optimization Granularity=Blockwise2025.05 | 40.91 | — | — | 0.39 | |
| TextGrad-MLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash, Optimization Granularity=Promptwise2025.05 | 40.82 | — | — | 0.28 | |
| AdalFlow-MLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash, Optimization Granularity=Promptwise2025.05 | 39.33 | — | — | 0.012 | |
| GEPABackbone=Qwen3 8B, Optimization Budget (# rollouts)=35932025.07 | 38.61 | — | — | — | |
| TextGrad-MOptimization Strategy=Blockwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 38.35 | 74.59 | 2.2 | — | |
| TextGradLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash, Validation Revert Strategy=w/2025.05 | 38.12 | — | — | 0.17 | |
| COPRO-MLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash, Optimization Granularity=Blockwise2025.05 | 38.12 | — | — | 0.56 | |
| TextGrad-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 38.02 | 74.12 | 1.73 | — | |
| AdalFlowLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash2025.05 | 38 | — | — | 0.01 | |
| COPRO-MLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash, Optimization Granularity=Promptwise2025.05 | 37.92 | — | — | 0.45 | |
| TextGradLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash, Validation Revert Strategy=w/o2025.05 | 37.56 | — | — | 0.04 | |
| COPRO-MOptimization Strategy=Blockwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 37.52 | 68.9 | 1.05 | — | |
| TextGradValidation Protocol=w/ val revert, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 37.5 | 72.39 | — | — | |
| TextGradValidation Protocol=w/o val revert, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 37.2 | 72.96 | — | — | |
| BaselineBackbone=Qwen3 8B2025.07 | 36.9 | — | — | — | |
| COPROLMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash2025.05 | 36.89 | — | — | 0.56 | |
| AdalFlow-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 36.67 | 72.63 | 0.8 | — | |
| COPRO-MOptimization Strategy=Promptwise, LMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 36.25 | 68.79 | 0.94 | — | |
| MIPROv2Backbone=Qwen3 8B2025.07 | 36.22 | — | — | — | |
| GEPALMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 36 | 72.11 | — | — | |
| GRPOBackbone=Qwen3 8B, Optimization Budget (# rollouts)=240002025.07 | 35.88 | — | — | — | |
| GEPALMforward=Gemini 2.5 flash-lite, LMbackward=Gemini 2.5 flash2025.05 | 35.67 | — | — | 0.012 | |
| AdalFlowLMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 35.33 | 71.83 | — | — | |
| COPROLMforward=GPT-4o-mini, LMbackward=GPT-4o2025.05 | 34.12 | 67.84 | — | — | |
| GEPA+MergeBackbone=Qwen3 8B, Optimization Budget (# rollouts)=35932025.07 | 28.23 | — | — | — |