Long-form Question Answering on Long-form QA Datasets Average Clean RAG
87.56VeriScore F1@kMIRAGE
Evaluation Results
| Method | Links | |
|---|---|---|
| MIRAGEBackbone=GPT-4o-mini2026.07 | 87.56 | |
| RAGBackbone=GPT-4o-mini2026.07 | 85.32 | |
| MIRAGEBackbone=Mistral-7B2026.07 | 84.09 | |
| MIRAGEBackbone=GPT-o1-mini2026.07 | 83.57 | |
| RAGBackbone=GPT-o1-mini2026.07 | 82.69 | |
| RAGBackbone=Mistral-7B2026.07 | 82.15 | |
| MIRAGEBackbone=Qwen2-7B2026.07 | 78.45 | |
| MIRAGEBackbone=LLaMA-3.1-8B2026.07 | 76.36 | |
| RAGBackbone=Qwen2-7B2026.07 | 72.11 | |
| RAGBackbone=LLaMA-3.1-8B2026.07 | 70.64 |