Linguistic Reasoning on BigBench Hard Hyperbaton
80.2AccuracyPromptBreeder
Evaluation Results
| Method | Links | |
|---|---|---|
| PromptBreederevaluations=30 prompt evaluations2026.05 | 80.2 | |
| ReElicitevaluations=30 prompt evaluations2026.05 | 79.6 | |
| TextGradevaluations=30 prompt evaluations2026.05 | 79.1 | |
| OPROevaluations=30 prompt evaluations2026.05 | 78.3 | |
| APEevaluations=30 prompt evaluations2026.05 | 77 |