Fact-checking on Average across General and Medical Domains
73.6Overall AverageClaude 3.5-Sonnet
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude 3.5-SonnetScale=>300B2025.02 | 73.6 | |
| OpenAI o1Scale=>300B2025.02 | 72.9 | |
| DeepSeek-V3 671BScale=>300B2025.02 | 71.7 | |
| GraphCheckBackbone=Llama3.3 70B2025.02 | 71.1 | |
| GPT-4Scale=>300B2025.02 | 70.8 | |
| GraphCheckBackbone=Qwen 72B2025.02 | 70.7 | |
| GPT-4oScale=>300B2025.02 | 70.1 | |
| MiniCheck2025.02 | 68.1 | |
| Llama3.3 70B2025.02 | 65.3 | |
| GraphEval2025.02 | 65.1 | |
| AlignScore2025.02 | 63.7 | |
| Qwen2.5 72B2025.02 | 63.6 | |
| ACUEval2025.02 | 60.6 | |
| Llama3 8B2025.02 | 57 | |
| Qwen2.5 7B2025.02 | 54.7 |