Long-form Question Answering on Long-form QA Datasets Average, Full Pollution
78VeriScore F1@kMIRAGE
Evaluation Results
| Method | Links | |
|---|---|---|
| MIRAGEBackbone=GPT-4o-mini2026.07 | 78 | |
| MIRAGEBackbone=GPT-o1-mini2026.07 | 73.7 | |
| MIRAGEBackbone=Mistral-7B2026.07 | 72.29 | |
| MIRAGEBackbone=Qwen2-7B2026.07 | 71.44 | |
| MIRAGEBackbone=LLaMA-3.1-8B2026.07 | 70.34 | |
| RAGBackbone=GPT-4o-mini2026.07 | 39.87 | |
| RAGBackbone=GPT-o1-mini2026.07 | 37.69 | |
| RAGBackbone=Mistral-7B2026.07 | 32.67 | |
| RAGBackbone=Qwen2-7B2026.07 | 30.89 | |
| RAGBackbone=LLaMA-3.1-8B2026.07 | 25.11 |