Question Answering on HotpotQA (LLM-Acc and Cont-Acc)
94.5LLM AccuracyA-RAG (Full)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| A-RAG (Full)Backbone LLM=GPT-5-mini2026.02 | 94.5 | 88 | |
| A-RAG (Naive)Backbone LLM=GPT-5-mini2026.02 | 90.8 | 85.3 | |
| LinearRAGBackbone LLM=GPT-5-mini2026.02 | 86.2 | 77.6 | |
| HippoRAG2Backbone LLM=GPT-5-mini2026.02 | 84.8 | 75 | |
| GraphRAGBackbone LLM=GPT-5-mini2026.02 | 82.5 | 74.9 | |
| Naive RAGBackbone LLM=GPT-5-mini2026.02 | 81.2 | 79.5 | |
| HippoRAG2Backbone LLM=GPT-4o-mini2026.02 | 80.7 | 69.7 | |
| A-RAG (Full)Backbone LLM=GPT-4o-mini2026.02 | 77.1 | 74 | |
| FaithfulRAGBackbone LLM=GPT-5-mini2026.02 | 76.9 | 75.3 | |
| A-RAG (Naive)Backbone LLM=GPT-4o-mini2026.02 | 76.6 | 70.7 | |
| Naive RAGBackbone LLM=GPT-4o-mini2026.02 | 74.5 | 72.9 | |
| LinearRAGBackbone LLM=GPT-4o-mini2026.02 | 72 | 60.5 | |
| MA-RAGBackbone LLM=GPT-5-mini2026.02 | 67.1 | 57.9 | |
| Direct AnswerBackbone LLM=GPT-5-mini2026.02 | 63.6 | 53.5 | |
| RAGentABackbone LLM=GPT-4o-mini2026.02 | 63 | 62.4 | |
| RAGentABackbone LLM=GPT-5-mini2026.02 | 61.2 | 65 | |
| MA-RAGBackbone LLM=GPT-4o-mini2026.02 | 60.6 | 54.4 | |
| FaithfulRAGBackbone LLM=GPT-4o-mini2026.02 | 60.5 | 52.5 | |
| Direct AnswerBackbone LLM=GPT-4o-mini2026.02 | 45.4 | 40.7 | |
| GraphRAGBackbone LLM=GPT-4o-mini2026.02 | 33.2 | 33.3 |