Long-form Question Answering on GraphRAG-Bench Med
93.1LLM AccuracyA-RAG (Full)
Evaluation Results
| Method | Links | |
|---|---|---|
| A-RAG (Full)Backbone LLM=GPT-5-mini2026.02 | 93.1 | |
| A-RAG (Naive)Backbone LLM=GPT-5-mini2026.02 | 92.7 | |
| Direct AnswerBackbone LLM=GPT-5-mini2026.02 | 90.5 | |
| GraphRAGBackbone LLM=GPT-5-mini2026.02 | 87.3 | |
| Naive RAGBackbone LLM=GPT-5-mini2026.02 | 86.1 | |
| A-RAG (Full)Backbone LLM=GPT-4o-mini2026.02 | 79.4 | |
| LinearRAGBackbone LLM=GPT-5-mini2026.02 | 79.2 | |
| A-RAG (Naive)Backbone LLM=GPT-4o-mini2026.02 | 79 | |
| HippoRAG2Backbone LLM=GPT-5-mini2026.02 | 78.2 | |
| FaithfulRAGBackbone LLM=GPT-5-mini2026.02 | 75.4 | |
| Naive RAGBackbone LLM=GPT-4o-mini2026.02 | 75.3 | |
| RAGentABackbone LLM=GPT-5-mini2026.02 | 73.7 | |
| HippoRAG2Backbone LLM=GPT-4o-mini2026.02 | 72 | |
| Direct AnswerBackbone LLM=GPT-4o-mini2026.02 | 68.6 | |
| MA-RAGBackbone LLM=GPT-5-mini2026.02 | 68.3 | |
| RAGentABackbone LLM=GPT-4o-mini2026.02 | 67.7 | |
| MA-RAGBackbone LLM=GPT-4o-mini2026.02 | 62.3 | |
| LinearRAGBackbone LLM=GPT-4o-mini2026.02 | 53.1 | |
| GraphRAGBackbone LLM=GPT-4o-mini2026.02 | 51.3 | |
| FaithfulRAGBackbone LLM=GPT-4o-mini2026.02 | 42.5 |