Fact-checking on SummEval
77.3Balanced AccuracyClaude 3.5-Sonnet
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude 3.5-SonnetScale=>300B2025.02 | 77.3 | |
| GPT-4oScale=>300B2025.02 | 76.3 | |
| MiniCheck2025.02 | 74.8 | |
| GraphCheckBackbone=Qwen 72B2025.02 | 71 | |
| OpenAI o1Scale=>300B2025.02 | 70.5 | |
| GPT-4Scale=>300B2025.02 | 69.7 | |
| GraphEval2025.02 | 69.7 | |
| DeepSeek-V3 671BScale=>300B2025.02 | 68.3 | |
| GraphCheckBackbone=Llama3.3 70B2025.02 | 67.3 | |
| AlignScore2025.02 | 62.2 | |
| Qwen2.5 7B2025.02 | 58.5 | |
| Llama3.3 70B2025.02 | 57.6 | |
| ACUEval2025.02 | 53.7 | |
| Qwen2.5 72B2025.02 | 53.4 | |
| Llama3 8B2025.02 | 51.7 |