Single-Hop Question Answering on NQ (EM)
51.7Exact Match (EM)Tree-GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Tree-GRPOBackbone=Qwen2.5-14b2025.09 | 51.7 | |
| GRPOBackbone=Qwen2.5-14b2025.09 | 51.3 | |
| GSPOBackbone=Qwen2.5-14b2025.09 | 50.7 | |
| MR-Search-BaseTraining Pipeline=Pure RL, External Teacher=None, Backbone=Qwen2.5-7B2026.05 | 50.2 | |
| SD-Search-BaseTraining Pipeline=Pure RL, External Teacher=None, Backbone=Qwen2.5-7B2026.05 | 50 | |
| SD-Search-InstructTraining Pipeline=Pure RL, External Teacher=None, Backbone=Qwen2.5-7B2026.05 | 49.5 | |
| AutoRefineBackbone=Qwen2.5-7B-Instruct2026.03 | 48.4 | |
| AutoRefine-BaseTraining Pipeline=Pure RL, External Teacher=None, Backbone=Qwen2.5-7B2026.05 | 48.4 | |
| Tree-GRPOBackbone=Qwen2.5-7b2025.09 | 48.1 | |
| SKILLGRAPHEvaluation Protocol=In-domain2026.05 | 48 | |
| Tree-GRPOBackbone=Llama3.2-3b2025.09 | 47.7 | |
| GSPOBackbone=Qwen2.5-7b2025.09 | 47 | |
| Search-R1-BaseTraining Pipeline=Pure RL, External Teacher=None, Backbone=Qwen2.5-7B2026.05 | 46.9 | |
| Tree-GRPOBackbone=Qwen2.5-3b2025.09 | 46.8 | |
| AutoRefineBackbone=Qwen2.5-3B-Instruct2026.03 | 46.7 | |
| SkillRLEvaluation Protocol=In-domain2026.05 | 45.9 | |
| GRPOBackbone=Qwen2.5-7b2025.09 | 45.8 | |
| GRPOBackbone=Llama3.2-3b2025.09 | 45.5 | |
| Thinker-InstructTraining Pipeline=Synthesize → SFT, External Teacher=Qwen2.5-72B, Backbone=Qwen2.5-7B2026.05 | 45 | |
| GRPOBackbone=Qwen2.5-3b2025.09 | 44.4 | |
| Tree-GRPOBackbone=Qwen2.5-1.5b2025.09 | 43.6 | |
| ZeroSearchEvaluation Protocol=In-domain2026.05 | 43.6 | |
| EvolveREvaluation Protocol=In-domain2026.05 | 43.5 | |
| GSPOBackbone=Qwen2.5-3b2025.09 | 43 | |
| GSPOBackbone=Llama3.2-3b2025.09 | 41.2 | |
| GRPOBackbone=Qwen2.5-1.5b2025.09 | 39.4 | |
| Search-R1Backbone=Qwen2.5-7B-Instruct2026.03 | 39.3 | |
| Search-R1Evaluation Protocol=In-domain2026.05 | 39.3 | |
| Search-R1-InstructTraining Pipeline=Pure RL, External Teacher=None, Backbone=Qwen2.5-7B2026.05 | 39.3 | |
| EvalActBackbone=Qwen2.5-3B-Instruct2026.03 | 38.5 | |
| EvalActBackbone=Qwen2.5-7B-Instruct2026.03 | 38.5 | |
| GSPOBackbone=Qwen2.5-1.5b2025.09 | 36.8 | |
| ReActBackbone=Qwen2.5-14b2025.09 | 36.1 | |
| Naïve RAGBackbone=Qwen2.5-7B-Instruct2026.03 | 34.9 | |
| Naïve RAGBackbone=Qwen2.5-3B-Instruct2026.03 | 34.8 | |
| Search-o1Backbone=Qwen2.5-14b2025.09 | 34.7 | |
| Search-R1Backbone=Qwen2.5-3B-Instruct2026.03 | 34.1 | |
| ReActBackbone=Qwen2.5-7b2025.09 | 30.6 | |
| RAGEvaluation Protocol=In-domain2026.05 | 27.4 | |
| Search-o1Backbone=Llama3.2-3b2025.09 | 24.2 | |
| ReActBackbone=Llama3.2-3b2025.09 | 23.9 | |
| Search-o1Backbone=Qwen2.5-3B-Instruct2026.03 | 23.8 | |
| Search-o1Backbone=Qwen2.5-7b2025.09 | 23.8 | |
| IRCoTBackbone=Qwen2.5-7B-Instruct2026.03 | 22.4 | |
| ReActBackbone=Qwen2.5-3b2025.09 | 21.1 | |
| Direct InferenceBackbone=Qwen2.5-14b2025.09 | 19.8 | |
| Search-o1Evaluation Protocol=In-domain2026.05 | 19.4 | |
| Direct InferenceBackbone=Llama3.2-3b2025.09 | 16.2 | |
| Search-o1Backbone=Qwen2.5-7B-Instruct2026.03 | 15.1 | |
| Search-o1Backbone=Qwen2.5-3b2025.09 | 15.1 | |
| Direct GenerationBackbone=Qwen2.5-7B-Instruct2026.03 | 13.4 | |
| Direct InferenceBackbone=Qwen2.5-7b2025.09 | 13.4 | |
| CoTEvaluation Protocol=In-domain2026.05 | 12.8 | |
| Qwen2.5-7B-InstructEvaluation Protocol=In-domain2026.05 | 11.6 | |
| IRCoTBackbone=Qwen2.5-3B-Instruct2026.03 | 11.1 | |
| Direct GenerationBackbone=Qwen2.5-3B-Instruct2026.03 | 10.6 | |
| Direct InferenceBackbone=Qwen2.5-3b2025.09 | 10.6 | |
| Search-o1Backbone=Qwen2.5-1.5b2025.09 | 10.2 | |
| ReActBackbone=Qwen2.5-1.5b2025.09 | 9.5 | |
| Direct InferenceBackbone=Qwen2.5-1.5b2025.09 | 7.1 |