Factuality Evaluation on LongForm
33.4PrecisionGPT4o-mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT4o-mini2026.04 | 33.4 | 7.2 | 8.6 | |
| Llama-3.1-70B-Inst2026.04 | 27.7 | 8.5 | 8.9 | |
| Gemini2.5-flash-lite2026.04 | 24.5 | 8.3 | 8.2 | |
| Llama-3.1-8B-Inst2026.04 | 22.7 | 5.3 | 5.3 | |
| Mistral-7B-instruct-v0.32026.04 | 20.7 | 6.2 | 6 | |
| Qwen2.5-7B-Instruct2026.04 | 20.1 | 4.4 | 4.2 |