Fact-checking on DeepFact-Bench (test)
87.2AccuracyDeepFact-Eval
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DeepFact-EvalBackbone=GPT-52026.03 | 87.2 | 89.9 | 87.9 | 91.9 | |
| DeepFact-EvalBackbone=GPT-4.1, Input Tokens=516.9K, Output Tokens=18.6K, Cost=$1.162026.03 | 83.4 | 86.9 | 85.7 | 88.2 | |
| DeepFact-EvalBackbone=Gemini-2.5-Pro2026.03 | 81.5 | 85 | 84.6 | 85.3 | |
| DeepFact-Eval (Group=5)Backbone=GPT-4.1, Group Size=5, Input Tokens=131.4K, Output Tokens=4.9K, Cost=$0.302026.03 | 77.9 | 83.1 | 78.5 | 88.2 | |
| DeepFact-Eval (Group=10)Backbone=GPT-4.1, Group Size=10, Input Tokens=93.5K, Output Tokens=3.5K, Cost=$0.212026.03 | 76.3 | 82.2 | 76.4 | 89 | |
| DeepFact-EvalBackbone=Qwen-3-32B2026.03 | 72.5 | 77.4 | 78.1 | 76.6 | |
| GPT-Researcher (Deep)Backbone=GPT-4.1, Input Tokens=52.3K, Output Tokens=9.0K, Cost=$0.182026.03 | 69.1 | 79.7 | 66.7 | 98.9 | |
| SmolAgentsBackbone=GPT-4.1, Input Tokens=294.4K, Output Tokens=3.4K, Cost=$0.622026.03 | 68.8 | 69.5 | 58 | 86.7 | |
| GPT-Researcher (Deep+)Backbone=GPT-4.1, Input Tokens=83.3K, Output Tokens=13.9K, Cost=$0.282026.03 | 68.3 | 79.3 | 66.1 | 99.2 | |
| FireBackbone=GPT-4.12026.03 | 58.5 | 63.2 | 69.2 | 58.3 | |
| SAFEBackbone=GPT-4.12026.03 | 55.9 | 53 | 76.3 | 40.6 | |
| Factcheck-GPTBackbone=GPT-4.12026.03 | 55 | 58.3 | 67.7 | 51.2 | |
| VeriScoreBackbone=GPT-4.12026.03 | 52.5 | 48.9 | 71.9 | 37 |