Linguistic Reasoning on BigBench Hard Snarks
0.554AccuracyTextGrad
Evaluation Results
| Method | Links | |
|---|---|---|
| TextGradevaluations=30 prompt evaluations2026.05 | 0.554 | |
| ReElicitevaluations=30 prompt evaluations2026.05 | 0.551 | |
| PromptBreederevaluations=30 prompt evaluations2026.05 | 0.539 | |
| OPROevaluations=30 prompt evaluations2026.05 | 0.537 | |
| APEevaluations=30 prompt evaluations2026.05 | 0.527 |