Multi-hop Question Answering on HotpotQA (EM, F1, Acc, Avg)
62.6AccuracySPARC-RAG
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| SPARC-RAGBackbone=Qwen3-32B2026.01 | 62.6 | 68.7 | 55 | 62.1 | |
| DeepNoteBackbone=Qwen3-32B2026.01 | 60.2 | 65.2 | 51.2 | 58.9 | |
| GRPOFramework=Agent-R1, Backbone=Qwen3-4B, Type=RL-optimized2025.11 | 59.4 | — | — | — | |
| SPARC-RAG + DPOBackbone=Qwen3-32B, fine-tuned=true2026.01 | 58.2 | 65 | 51 | 58.1 | |
| PPOFramework=Agent-R1, Backbone=Qwen3-4B, Type=RL-optimized2025.11 | 56.7 | — | — | — | |
| RLOOFramework=Agent-R1, Backbone=Qwen3-4B, Type=RL-optimized2025.11 | 55.2 | — | — | — | |
| SPARC-RAG + DPOBackbone=Qwen2.5-7B-Instruct, fine-tuned=true2026.01 | 53.8 | 61.3 | 49.4 | 54.8 | |
| Self-RAGBackbone=Qwen3-32B2026.01 | 53 | 57.9 | 45 | 52 | |
| Reinforce++Framework=Agent-R1, Backbone=Qwen3-4B, Type=RL-optimized2025.11 | 52.8 | — | — | — | |
| Iter-RetGenBackbone=Qwen3-32B2026.01 | 52.4 | 61.4 | 48.6 | 54.1 | |
| Vanilla RAGBackbone=Qwen3-32B2026.01 | 51.2 | 37.3 | 21.8 | 36.8 | |
| Sequential (Naive)Backbone=Qwen3-32B2026.01 | 51.2 | 37.4 | 22.2 | 36.9 | |
| Parallel (Naive)Backbone=Qwen3-32B2026.01 | 51 | 38.1 | 23.6 | 37.6 | |
| DeepNoteBackbone=Qwen2.5-7B-Instruct2026.01 | 50.6 | 59.2 | 48 | 52.6 | |
| SPARC-RAGBackbone=Qwen2.5-7B-Instruct2026.01 | 48.4 | 55.9 | 45.4 | 49.9 | |
| Iter-RetGenBackbone=Qwen2.5-7B-Instruct2026.01 | 48 | 50.2 | 38.6 | 45.6 | |
| Sequential (Naive)Backbone=Qwen2.5-7B-Instruct2026.01 | 43.2 | 41.3 | 30.2 | 38.2 | |
| Self-RAGBackbone=Qwen2.5-7B-Instruct2026.01 | 42.6 | 46 | 35.4 | 41.3 | |
| Vanilla RAGBackbone=Qwen2.5-7B-Instruct2026.01 | 42.4 | 42.5 | 32 | 39 | |
| Search-R1++Backbone=Qwen2.5-7B, Agent Type=RL trained Deep Research Agents2026.02 | 42.3 | — | — | — | |
| Parallel (Naive)Backbone=Qwen2.5-7B-Instruct2026.01 | 41 | 42.4 | 32.6 | 38.7 | |
| IRCoTBackbone=Qwen2.5-7B-Instruct2026.01 | 40.4 | 33.8 | 23.2 | 32.5 | |
| Search-R1Backbone=Qwen2.5-7B, Agent Type=RL trained Deep Research Agents2026.02 | 36.1 | — | — | — | |
| IRCoTBackbone=Qwen3-32B2026.01 | 34.4 | 36.1 | 27.2 | 32.6 | |
| Speculative-RAGBackbone=Qwen3-32B2026.01 | 33.6 | 39 | 31.2 | 34.6 | |
| Speculative-RAGBackbone=Qwen2.5-7B-Instruct2026.01 | 29.2 | 34.6 | 28.2 | 30.7 | |
| ReActFramework=Agent-R1, Backbone=Qwen3-4B, Type=Training-free baseline2025.11 | 25.8 | — | — | — | |
| R1-baseBackbone=Qwen2.5-7B, Agent Type=RL Trained LLM, Retrieval Setting=without Retrieval2026.02 | 24.2 | — | — | — | |
| ReActBackbone=Qwen2.5-7B, Agent Type=Training free Deep Research Agent2026.02 | 13.2 | — | — | — |