Long-form Question Answering on Novel GraphRAG-Bench
85.3LLM-AccA-RAG (Full)
Evaluation Results
| Method | Links | |
|---|---|---|
| A-RAG (Full)Backbone LLM=GPT-5-mini2026.02 | 85.3 | |
| A-RAG (Naive)Backbone LLM=GPT-5-mini2026.02 | 80.4 | |
| GraphRAGBackbone LLM=GPT-5-mini2026.02 | 77.1 | |
| A-RAG (Full)Backbone LLM=GPT-4o-mini2026.02 | 72.7 | |
| Naive RAGBackbone LLM=GPT-5-mini2026.02 | 70.6 | |
| HippoRAG2Backbone LLM=GPT-4o-mini2026.02 | 70.1 | |
| A-RAG (Naive)Backbone LLM=GPT-4o-mini2026.02 | 70 | |
| Naive RAGBackbone LLM=GPT-4o-mini2026.02 | 68.5 | |
| RAGentABackbone LLM=GPT-4o-mini2026.02 | 61.3 | |
| FaithfulRAGBackbone LLM=GPT-5-mini2026.02 | 60.7 | |
| RAGentABackbone LLM=GPT-5-mini2026.02 | 60.2 | |
| LinearRAGBackbone LLM=GPT-5-mini2026.02 | 54.7 | |
| HippoRAG2Backbone LLM=GPT-5-mini2026.02 | 54.3 | |
| LinearRAGBackbone LLM=GPT-4o-mini2026.02 | 45.4 | |
| Direct AnswerBackbone LLM=GPT-4o-mini2026.02 | 45.3 | |
| Direct AnswerBackbone LLM=GPT-5-mini2026.02 | 45.1 | |
| MA-RAGBackbone LLM=GPT-5-mini2026.02 | 45.1 | |
| MA-RAGBackbone LLM=GPT-4o-mini2026.02 | 44.5 | |
| FaithfulRAGBackbone LLM=GPT-4o-mini2026.02 | 33.3 | |
| GraphRAGBackbone LLM=GPT-4o-mini2026.02 | 28.8 |