Factuality Evaluation on LongFact
38.6PrecisionGPT4o-mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT4o-mini2026.04 | 38.6 | 42.6 | 36.8 | |
| Qwen2.5-7B-Instruct2026.04 | 36.5 | 34.7 | 30.7 | |
| Llama-3.1-8B-Inst2026.04 | 35.9 | 30.3 | 28.2 | |
| Mistral-7B-instruct-v0.32026.04 | 35.5 | 37.9 | 32.2 | |
| Llama-3.1-70B-Inst2026.04 | 34.4 | 31.8 | 27.4 | |
| Gemini2.5-flash-lite2026.04 | 28.6 | 44.4 | 30.4 |