Complex Question Answering on HotpotQA
70.4F1 ScoreGraphFlow
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GraphFlowModel=Qwen-2.5-7B2026.05 | 70.4 | 2.17 | |
| GraphFlowModel=Gemma-2-9B2026.05 | 69.8 | 4.05 | |
| GraphFlowModel=Llama-3.1-8B2026.05 | 68.3 | 2.38 | |
| AFlowModel=Qwen-2.5-7B2026.05 | 67.5 | 3.92 | |
| AgentKBModel=Qwen-2.5-7B2026.05 | 67 | 3.99 | |
| AutoFlowModel=Qwen-2.5-7B2026.05 | 66.8 | 4.55 | |
| AFlowModel=Gemma-2-9B2026.05 | 66.4 | 4.8 | |
| MetaGPTModel=Qwen-2.5-7B2026.05 | 65.7 | 3.28 | |
| TaskWeaverModel=Qwen-2.5-7B2026.05 | 65.6 | 6.4 | |
| LLMCompilerModel=Qwen-2.5-7B2026.05 | 65.3 | 3.12 | |
| AutoFlowModel=Gemma-2-9B2026.05 | 64.8 | 5.1 | |
| AgentKBModel=Gemma-2-9B2026.05 | 64.5 | 4.15 | |
| TaskWeaverModel=Gemma-2-9B2026.05 | 64.2 | 7.85 | |
| MetaGPTModel=Gemma-2-9B2026.05 | 63.7 | 4.5 | |
| LLMCompilerModel=Gemma-2-9B2026.05 | 63.5 | 3.55 | |
| AFlowModel=Llama-3.1-8B2026.05 | 63.2 | 3.75 | |
| AutoFlowModel=Llama-3.1-8B2026.05 | 62.8 | 4.88 | |
| AgentKBModel=Llama-3.1-8B2026.05 | 62.4 | 5.8 | |
| MetaGPTModel=Llama-3.1-8B2026.05 | 61.2 | 2.68 | |
| VanillaModel=Gemma-2-9B2026.05 | 61.2 | 1.51 | |
| TaskWeaverModel=Llama-3.1-8B2026.05 | 61.1 | 7.55 | |
| LLMCompilerModel=Llama-3.1-8B2026.05 | 60.8 | 3.25 | |
| VanillaModel=Qwen-2.5-7B2026.05 | 60.7 | 1.29 | |
| VanillaModel=Llama-3.1-8B2026.05 | 56.7 | 1.66 |