Question Answering on 2WikiMultihopQA (EM only)
36.8EMTeacher-3B
Evaluation Results
| Method | Links | |
|---|---|---|
| Teacher-3BModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B2025.08 | 36.8 | |
| DGPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 30.3 | |
| KDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 28.4 | |
| SFT → PPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 27.5 | |
| SeqKDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 27.3 | |
| DistiLLMModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 27 | |
| TAIDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 27 | |
| PPOModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 21.8 | |
| GKDModel Family=Qwen 2.5, Teacher Model=Qwen 2.5 3B, Student Model=Qwen 2.5 0.5B2025.08 | 21.7 | |
| Student-0.5BModel Family=Qwen 2.5, Student Model=Qwen 2.5 0.5B2025.08 | 1.5 | |
| Search-E1-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Process-supervision RL2026.05 | 0.436 | |
| AutoRefine-BaseRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 0.393 | |
| AutoRefine-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 0.38 | |
| GiGPO-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Process-supervision RL2026.05 | 0.37 | |
| StepSearch-BaseRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Process-supervision RL2026.05 | 0.339 | |
| StepSearch-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Process-supervision RL2026.05 | 0.32 | |
| Search-R1-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 0.31 | |
| R1-InstructRetrieval Strategy=None2026.05 | 0.275 | |
| Search-R1-BaseRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 0.274 | |
| ReSearch-BaseRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 0.272 | |
| ReSearch-InstructRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Outcome-reward RL2026.05 | 0.272 | |
| R1-BaseRetrieval Strategy=None2026.05 | 0.268 | |
| SFTRetrieval Strategy=None2026.05 | 0.248 | |
| Direct GenerationRetrieval Strategy=None2026.05 | 0.244 | |
| Naive RAGRetrieval Strategy=Single-Hop Retrieval2026.05 | 0.226 | |
| Search-o1Retrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Prompting2026.05 | 0.218 | |
| IRCoTRetrieval Strategy=Multi-Hop Retrieval, Supervision Paradigm=Prompting2026.05 | 0.171 |