Long-form Question Answering on Long-form QA Datasets Average, Mixed Pollution
83.43VeriScore F1@kMIRAGE
Evaluation Results
| Method | Links | |
|---|---|---|
| MIRAGEBackbone=GPT-4o-mini2026.07 | 83.43 | |
| MIRAGEBackbone=GPT-o1-mini2026.07 | 80.52 | |
| MIRAGEBackbone=Qwen2-7B2026.07 | 74.96 | |
| MIRAGEBackbone=Mistral-7B2026.07 | 74.87 | |
| MIRAGEBackbone=LLaMA-3.1-8B2026.07 | 71.91 | |
| RAGBackbone=GPT-o1-mini2026.07 | 54.4 | |
| RAGBackbone=GPT-4o-mini2026.07 | 53.88 | |
| RAGBackbone=Qwen2-7B2026.07 | 46.64 | |
| RAGBackbone=Mistral-7B2026.07 | 45.12 | |
| RAGBackbone=LLaMA-3.1-8B2026.07 | 41.71 |