Question Answering on HotpotQA (test) (Accuracy and F1 Metrics)
59F1 ScoreIGPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| IGPOMethod Category=Step-reward RL-based2025.10 | 59 | — | |
| Search-r1-baseMethod Category=Outcome-reward RL-based2025.10 | 55.9 | — | |
| DeepResearcherMethod Category=Outcome-reward RL-based2025.10 | 52.8 | — | |
| StepSearch-instructMethod Category=Step-reward RL-based2025.10 | 50.2 | — | |
| StepSearch-baseMethod Category=Step-reward RL-based2025.10 | 49.3 | — | |
| ReasoningRAGMethod Category=Step-reward RL-based2025.10 | 48.9 | — | |
| FedGRPOModel=Qwen2.5-3B2026.02 | 48 | 32.2 | |
| Central-GRPOModel=Qwen2.5-3B2026.02 | 46.2 | 31.3 | |
| Search-r1-instructMethod Category=Outcome-reward RL-based2025.10 | 45.7 | — | |
| R1-searcherMethod Category=Outcome-reward RL-based2025.10 | 44.8 | — | |
| GiGPOMethod Category=Step-reward RL-based2025.10 | 41.6 | — | |
| DPSDA-FL+SFTModel=Qwen2.5-3B2026.02 | 38.4 | 28.8 | |
| CoT+RAGMethod Category=Prompt-based2025.10 | 37.1 | — | |
| Search-o1Method Category=Prompt-based2025.10 | 33 | — | |
| DPSDA-FL+GRPOModel=Qwen2.5-3B2026.02 | 27.5 | 26.4 | |
| FedGRPOModel=Qwen2.5-1.5B2026.02 | 26.1 | 27.2 | |
| Central-GRPOModel=Qwen2.5-1.5B2026.02 | 25.4 | 27.7 | |
| DPSDA-FL+SFTModel=Qwen2.5-1.5B2026.02 | 24.9 | 23.8 | |
| Fedpetuning+SFTModel=Qwen2.5-3B2026.02 | 24.8 | 21.1 | |
| CoTMethod Category=Prompt-based2025.10 | 24.4 | — | |
| Fedpetuning+GRPOModel=Qwen2.5-3B2026.02 | 23.9 | 17.7 | |
| DPSDA-FL+GRPOModel=Qwen2.5-1.5B2026.02 | 23.4 | 21.1 | |
| Fedpetuning+SFTModel=Qwen2.5-1.5B2026.02 | 14.7 | 11.4 | |
| Fedpetuning+GRPOModel=Qwen2.5-1.5B2026.02 | 12.1 | 9.8 | |
| Zero-shotModel=Qwen2.5-3B2026.02 | 6.1 | 6.3 | |
| Zero-shotModel=Qwen2.5-1.5B2026.02 | 1 | 1.7 |