Pairwise Comparison on SummEval (anchor set)
94.5AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o2025.02 | 94.5 | |
| GPT-4o mini2025.02 | 93.4 | |
| CompassJudger-32BParameters=32B2025.02 | 92 | |
| GPT-4 Turbo2025.02 | 91.1 | |
| Phi-4-14BParameters=14B2025.02 | 87.4 | |
| Qwen-2.5-72BParameters=72B2025.02 | 86 |