Question Answering on HotpotQA (test) (EM and F1)
68EMAriGraph
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AriGraphModel=gpt42025.11 | 68 | 74.7 | |
| HOLMESModel=gpt42025.11 | 66 | 78 | |
| WikonticModel=gpt4.12025.11 | 64.5 | 76 | |
| HippoRAG v2Model=Llama 3.32025.11 | 62.7 | 75.5 | |
| AriGraphModel=gpt4o-mini2025.11 | 60 | 68 | |
| WikonticModel=gpt4.1-mini2025.11 | 59.7 | 71.7 | |
| GraphRAGModel=gpt4o-mini2025.11 | 58.7 | 63.3 | |
| Supporting factsModel=gpt42025.11 | 57 | 73.8 | |
| WikonticModel=Llama 3.32025.11 | 55.1 | 67.4 | |
| GraphReaderModel=gpt42025.11 | 55 | 70 | |
| WikonticModel=gpt4o-mini2025.11 | 53.7 | 65.8 | |
| Full contextModel=gpt42025.11 | 53 | 68.4 | |
| ReadAgentModel=gpt42025.11 | 48.9 | 62 | |
| DotRetriever=Contriever (fine-tuned on MS MARCO 80K), Reader=Flan-T5-Large, Similarity=Dot2026.02 | 32.9 | 42.7 | |
| QNormRetriever=Contriever (fine-tuned on MS MARCO 80K), Reader=Flan-T5-Large, Similarity=QNorm2026.02 | 32.7 | 42.4 | |
| LearnRetriever=Contriever (fine-tuned on MS MARCO 80K), Reader=Flan-T5-Large, Similarity=Learn (learnable normalization)2026.02 | 32.6 | 42.4 | |
| DNormRetriever=Contriever (fine-tuned on MS MARCO 80K), Reader=Flan-T5-Large, Similarity=DNorm2026.02 | 31.5 | 41 | |
| CosineRetriever=Contriever (fine-tuned on MS MARCO 80K), Reader=Flan-T5-Large, Similarity=Cosine2026.02 | 27.2 | 35.9 |