Multi-hop Question Answering on HotpotQA (official evaluation)
33.2EM AccuracyM3PO
Evaluation Results
| Method | Links | |
|---|---|---|
| M3POBackbone=Qwen2.5-3B-Instruct, Strategy=Multi-Path Perception Policy Optimization, Context Retrieval=Top-3 documents2025.12 | 33.2 | |
| HRPOBackbone=Qwen2.5-3B-Instruct, Strategy=Hybrid Reasoning Policy Optimization, Context Retrieval=Top-3 documents2025.12 | 31.6 | |
| GRPOBackbone=Qwen2.5-3B-Instruct, Strategy=GRPO, Context Retrieval=Top-3 documents2025.12 | 30.8 | |
| PPOBackbone=Qwen2.5-3B-Instruct, Strategy=PPO, Context Retrieval=Top-3 documents2025.12 | 30.4 | |
| RAGBackbone=Qwen2.5-7B-Instruct, Strategy=Retrieval-Augmented Generation, Context Retrieval=Top-3 documents2025.12 | 29.9 | |
| M3POBackbone=Qwen2.5-1.5B-Instruct, Strategy=Multi-Path Perception Policy Optimization, Context Retrieval=Top-3 documents2025.12 | 28.7 | |
| HRPOBackbone=Qwen2.5-1.5B-Instruct, Strategy=Hybrid Reasoning Policy Optimization, Context Retrieval=Top-3 documents2025.12 | 27.3 | |
| PPOBackbone=Qwen2.5-1.5B-Instruct, Strategy=PPO, Context Retrieval=Top-3 documents2025.12 | 25.6 | |
| RAGBackbone=Qwen2.5-3B-Instruct, Strategy=Retrieval-Augmented Generation, Context Retrieval=Top-3 documents2025.12 | 25.5 | |
| RAGBackbone=Qwen2.5-1.5B-Instruct, Strategy=Retrieval-Augmented Generation, Context Retrieval=Top-3 documents2025.12 | 22.8 | |
| GRPOBackbone=Qwen2.5-1.5B-Instruct, Strategy=GRPO, Context Retrieval=Top-3 documents2025.12 | 20.2 | |
| Search-o1Backbone=Qwen2.5-7B-Instruct, Strategy=Search-o1, Context Retrieval=Top-3 documents2025.12 | 18.7 | |
| SFTBackbone=Qwen2.5-3B-Instruct, Strategy=Supervised Fine-Tuning, Context Retrieval=Top-3 documents2025.12 | 18.6 | |
| QABackbone=Qwen2.5-7B-Instruct, Strategy=Direct inference, Context Retrieval=Top-3 documents2025.12 | 18.3 | |
| IRCoTBackbone=Qwen2.5-7B-Instruct, Strategy=Interleaved retrieval with CoT, Context Retrieval=Top-3 documents2025.12 | 13.3 | |
| SFTBackbone=Qwen2.5-1.5B-Instruct, Strategy=Supervised Fine-Tuning, Context Retrieval=Top-3 documents2025.12 | 12.9 | |
| CoTBackbone=Qwen2.5-7B-Instruct, Strategy=Chain-of-Thought, Context Retrieval=Top-3 documents2025.12 | 9.2 |