Causal Reasoning on BBH Causal Judgement
78Accuracy (BBH Causal Judgement)evaluation-instructed prompt optimization
Evaluation Results
| Method | Links | |
|---|---|---|
| evaluation-instructed prompt optimizationBackbone=GPT-4o, Optimization Type=Query-dependent2025.11 | 78 | |
| Pro-RefineBackbone=GPT-4o, Optimization Type=Query-dependent2025.11 | 75 | |
| Self-RefineBackbone=GPT-4o, Optimization Type=Query-dependent2025.11 | 74 | |
| TextGradBackbone=GPT-4o, Optimization Type=Template2025.11 | 74 | |
| LLM onlyBackbone=GPT-4o, Optimization Type=None2025.11 | 73 | |
| PSAO_LLMBackbone Model=Gemini-2-Flash, Prompt Optimization Technique=PSAO_LLM2026.05 | 72.73 | |
| APEBackbone=GPT-4o, Optimization Type=Template2025.11 | 72 | |
| MIPROModel=GPT-4o2026.05 | 70.91 | |
| MIPROLLM=GPT-4o2026.05 | 70.91 | |
| GEPABackbone Model=Gemini-2-Flash, Prompt Optimization Technique=GEPA2026.05 | 70.7 | |
| COPROModel=GPT-4o2026.05 | 70 | |
| COPROLLM=GPT-4o2026.05 | 70 | |
| PSAO_LLMModel=GPT-4o2026.05 | 69.07 | |
| PSAO_LLMLLM=GPT-4o2026.05 | 69.07 | |
| ProTeGiBackbone Model=Gemini-2-Flash, Prompt Optimization Technique=ProTeGi2026.05 | 68.91 | |
| COPROBackbone Model=Gemini-2-Flash, Prompt Optimization Technique=COPRO2026.05 | 68.91 | |
| BaselineLLM=GPT-4o2026.05 | 68.73 | |
| PromptAgentBackbone Model=Gemini-2-Flash, Prompt Optimization Technique=PromptAgent2026.05 | 68.55 | |
| GEPALLM=GPT-4o2026.05 | 68 | |
| ProTeGiLLM=GPT-4o2026.05 | 67.27 | |
| MIPROBackbone Model=Gemini-2-Flash, Prompt Optimization Technique=MIPRO2026.05 | 67.09 | |
| BaselineBackbone Model=Gemini-2-Flash, Prompt Optimization Technique=Baseline2026.05 | 66.36 | |
| PromptAgentLLM=GPT-4o2026.05 | 65.09 | |
| evaluation-instructed prompt optimizationBackbone=LLaMA-3.1, Optimization Type=Query-dependent2025.11 | 64 | |
| evaluation-instructed prompt optimizationBackbone=LLaMA-3, Optimization Type=Query-dependent2025.11 | 63 | |
| TextGradBackbone=LLaMA-3, Optimization Type=Template2025.11 | 62 | |
| Pro-RefineBackbone=LLaMA-3, Optimization Type=Query-dependent2025.11 | 61 | |
| Pro-RefineBackbone=LLaMA-3.1, Optimization Type=Query-dependent2025.11 | 61 | |
| LLM onlyBackbone=LLaMA-3, Optimization Type=None2025.11 | 60 | |
| APEBackbone=LLaMA-3, Optimization Type=Template2025.11 | 59 | |
| Self-RefineBackbone=LLaMA-3.1, Optimization Type=Query-dependent2025.11 | 59 | |
| ReElicitevaluations=30 prompt evaluations2026.05 | 58.4 | |
| Self-RefineBackbone=LLaMA-3, Optimization Type=Query-dependent2025.11 | 58 | |
| LLM onlyBackbone=LLaMA-3.1, Optimization Type=None2025.11 | 58 | |
| OPROevaluations=30 prompt evaluations2026.05 | 57.1 | |
| APEevaluations=30 prompt evaluations2026.05 | 57 | |
| TextGradBackbone=LLaMA-3.1, Optimization Type=Template2025.11 | 57 | |
| TextGradevaluations=30 prompt evaluations2026.05 | 56 | |
| PromptBreederevaluations=30 prompt evaluations2026.05 | 55.8 | |
| APEBackbone=LLaMA-3.1, Optimization Type=Template2025.11 | 53 |