Legal Reasoning on LegalBench (accuracy)
90Accuracyevaluation-instructed prompt optimization
Evaluation Results
| Method | Links | |
|---|---|---|
| evaluation-instructed prompt optimizationBackbone=GPT-4o, Optimization Type=Query-dependent2025.11 | 90 | |
| Pro-RefineBackbone=GPT-4o, Optimization Type=Query-dependent2025.11 | 86 | |
| TextGradBackbone=GPT-4o, Optimization Type=Template2025.11 | 84 | |
| APEBackbone=GPT-4o, Optimization Type=Template2025.11 | 84 | |
| LLM onlyBackbone=GPT-4o, Optimization Type=None2025.11 | 83 | |
| Self-RefineBackbone=GPT-4o, Optimization Type=Query-dependent2025.11 | 81 | |
| evaluation-instructed prompt optimizationBackbone=LLaMA-3, Optimization Type=Query-dependent2025.11 | 70 | |
| evaluation-instructed prompt optimizationBackbone=LLaMA-3.1, Optimization Type=Query-dependent2025.11 | 69 | |
| Self-RefineBackbone=LLaMA-3, Optimization Type=Query-dependent2025.11 | 63 | |
| Pro-RefineBackbone=LLaMA-3, Optimization Type=Query-dependent2025.11 | 63 | |
| Self-RefineBackbone=LLaMA-3.1, Optimization Type=Query-dependent2025.11 | 63 | |
| Pro-RefineBackbone=LLaMA-3.1, Optimization Type=Query-dependent2025.11 | 63 | |
| APEBackbone=LLaMA-3.1, Optimization Type=Template2025.11 | 61 | |
| TextGradBackbone=LLaMA-3, Optimization Type=Template2025.11 | 58 | |
| TextGradBackbone=LLaMA-3.1, Optimization Type=Template2025.11 | 58 | |
| LLM onlyBackbone=LLaMA-3.1, Optimization Type=None2025.11 | 56 | |
| LLM onlyBackbone=LLaMA-3, Optimization Type=None2025.11 | 55 | |
| APEBackbone=LLaMA-3, Optimization Type=Template2025.11 | 55 |