Fact-checking on SCIFact
90.3Balanced AccOpenAI o1
Evaluation Results
| Method | Links | |
|---|---|---|
| OpenAI o1Scale=>300B2025.02 | 90.3 | |
| GraphCheckBackbone=Llama3.3 70B2025.02 | 89.4 | |
| DeepSeek-V3 671BScale=>300B2025.02 | 89.1 | |
| Claude 3.5-SonnetScale=>300B2025.02 | 87.2 | |
| GraphCheckBackbone=Qwen 72B2025.02 | 86.4 | |
| Llama3.3 70B2025.02 | 85.7 | |
| Qwen2.5 72B2025.02 | 85.6 | |
| GPT-4Scale=>300B2025.02 | 83.3 | |
| GPT-4oScale=>300B2025.02 | 83.2 | |
| ACUEval2025.02 | 79.9 | |
| MiniCheck2025.02 | 78.1 | |
| AlignScore2025.02 | 71.7 | |
| GraphEval2025.02 | 68.4 | |
| Llama3 8B2025.02 | 62.2 | |
| Qwen2.5 7B2025.02 | 53.5 |