Open-domain Question Answering on 5 QA Benchmarks Average
40.9Average Exact MatchPyRAG
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| PyRAGBackbone=Qwen2.5-72B-Instruct2026.05 | 40.9 | 14.4 | |
| ITER-RETGENBackbone=Qwen2.5-72B-Instruct2026.05 | 36.3 | — | |
| IRCoTBackbone=Qwen2.5-72B-Instruct2026.05 | 34.8 | — | |
| Self-AskBackbone=Qwen2.5-72B-Instruct2026.05 | 32 | — | |
| PyRAGBackbone=Qwen2.5-7B-Instruct2026.05 | 30.8 | 11.8 | |
| Vanilla RAGBackbone=Qwen2.5-72B-Instruct2026.05 | 26.5 | — | |
| ITER-RETGENBackbone=Qwen2.5-7B-Instruct2026.05 | 26.2 | — | |
| IRCoTBackbone=Qwen2.5-7B-Instruct2026.05 | 24.7 | — | |
| CoTBackbone=Qwen2.5-72B-Instruct2026.05 | 22.5 | — | |
| Self-AskBackbone=Qwen2.5-7B-Instruct2026.05 | 22 | — | |
| Vanilla RAGBackbone=Qwen2.5-7B-Instruct2026.05 | 19 | — | |
| Direct InferenceBackbone=Qwen2.5-72B-Instruct2026.05 | 18.8 | — | |
| Direct InferenceBackbone=Qwen2.5-7B-Instruct2026.05 | 12 | — | |
| CoTBackbone=Qwen2.5-7B-Instruct2026.05 | 10.2 | — |