LLM Judging on JudgeBench (GPT-4o 1.0 Generated Responses)
68.18KnowledgeGPT-4O
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| GPT-4OVersion=2024-11-20, Prompting Goal=reverse goal, Strategy=SOP prompting2025.03 | 68.18 | 61.22 | 71.43 | 63.81 | 66.23 | |
| CLAUDE-3.5-SONNETVersion=2024-06-20, Prompting Goal=reverse goal, Strategy=SOP prompting2025.03 | 62.99 | 66.32 | 76.79 | 61.9 | 66 | |
| GPT-4OVersion=2024-11-20, Prompting Goal=original goal2025.03 | 61.04 | 56.12 | 73.21 | 61.9 | 61.71 | |
| CLAUDE-3.5-SONNETVersion=2024-06-20, Prompting Goal=original goal, Evaluation Protocol=strict two-trial2025.03 | 59.74 | 62.24 | 60.71 | 54.76 | 60 | |
| GEMINI-1.5-PROVersion=002, Prompting Goal=original goal2025.03 | 57.79 | 52.04 | 71.43 | 47.62 | 57.14 | |
| GEMINI-1.5-PROVersion=002, Prompting Goal=reverse goal, Strategy=SOP prompting2025.03 | 56.49 | 59.18 | 76.79 | 47.62 | 59.43 | |
| GPT-4O-MINIVersion=2024-07-18, Prompting Goal=original goal, Evaluation Protocol=strict two-trial2025.03 | 46.75 | 42.86 | 66.07 | 42.86 | 48.29 | |
| GPT-4OVersion=2024-05-13, Prompting Goal=original goal, Evaluation Protocol=strict two-trial2025.03 | 46.1 | 48.98 | 62.5 | 52.38 | 50.29 | |
| GEMINI-1.5-PROVersion=001, Prompting Goal=original goal, Evaluation Protocol=strict two-trial2025.03 | 45.45 | 37.76 | 55.36 | 9.52 | 40.57 | |
| GEMINI-1.5-FLASHVersion=001, Prompting Goal=original goal, Evaluation Protocol=strict two-trial2025.03 | 26.62 | 20.41 | 30.36 | 9.52 | 23.43 | |
| CLAUDE-3-HAIKUVersion=2024-03-07, Prompting Goal=original goal, Evaluation Protocol=strict two-trial2025.03 | 20.78 | 14.29 | 16.07 | 2.38 | 16 |