Single-hop Question Answering on Single-hop QA Average
59.61F1 ScoreMemPO
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| MemPO2026.02 | 59.61 | 49.97 | 0.24 | 0.14 | — | |
| GRPOmemory=none2026.02 | 58.13 | 48.3 | 0.72 | 0.24 | — | |
| Tree-GRPOBackbone=Qwen2.5-14b2025.09 | 55.7 | — | — | — | 1.1 | |
| ReSearch2026.02 | 55.65 | 43.97 | 0.23 | 0.16 | — | |
| GRPOBackbone=Qwen2.5-14b2025.09 | 55.1 | — | — | — | — | |
| GSPOBackbone=Qwen2.5-14b2025.09 | 55.1 | — | — | — | 0 | |
| DeepResearcher2026.02 | 53.32 | 44.2 | 0.91 | 0.23 | — | |
| qwen2.5Mode=ReAct2026.02 | 53.23 | 43.13 | 1.44 | 0.26 | — | |
| GSPOBackbone=Qwen2.5-7b2025.09 | 52.5 | — | — | — | 4 | |
| Tree-GRPOBackbone=Qwen2.5-7b2025.09 | 52.2 | — | — | — | 3.4 | |
| GRPOBackbone=Qwen2.5-7b2025.09 | 50.5 | — | — | — | — | |
| Tree-GRPOBackbone=Qwen2.5-3b2025.09 | 50 | — | — | — | 4 | |
| Tree-GRPOBackbone=Llama3.2-3b2025.09 | 50 | — | — | — | 2.7 | |
| GRPOBackbone=Llama3.2-3b2025.09 | 48.7 | — | — | — | — | |
| GRPOBackbone=Qwen2.5-3b2025.09 | 48.1 | — | — | — | — | |
| GSPOBackbone=Qwen2.5-3b2025.09 | 48.1 | — | — | — | 0 | |
| Tree-GRPOBackbone=Qwen2.5-1.5b2025.09 | 47.5 | — | — | — | 9.5 | |
| GSPOBackbone=Llama3.2-3b2025.09 | 46.6 | — | — | — | -4.3 | |
| ReActBackbone=Qwen2.5-14b2025.09 | 46.5 | — | — | — | — | |
| GRPOBackbone=Qwen2.5-1.5b2025.09 | 43.4 | — | — | — | — | |
| GSPOBackbone=Qwen2.5-1.5b2025.09 | 41 | — | — | — | -5.5 | |
| Search-o1Backbone=Qwen2.5-14b2025.09 | 40.8 | — | — | — | — | |
| ReActBackbone=Qwen2.5-7b2025.09 | 40.5 | — | — | — | — | |
| Search-o1Backbone=Qwen2.5-7b2025.09 | 32.4 | — | — | — | — | |
| ReActBackbone=Qwen2.5-3b2025.09 | 31 | — | — | — | — | |
| Direct InferenceBackbone=Qwen2.5-14b2025.09 | 30.4 | — | — | — | — | |
| ReActBackbone=Llama3.2-3b2025.09 | 29.3 | — | — | — | — | |
| Search-o1Backbone=Llama3.2-3b2025.09 | 27.1 | — | — | — | — | |
| Search-o1Backbone=Qwen2.5-3b2025.09 | 24.2 | — | — | — | — | |
| Direct InferenceBackbone=Qwen2.5-7b2025.09 | 22.7 | — | — | — | — | |
| Direct InferenceBackbone=Llama3.2-3b2025.09 | 17.7 | — | — | — | — | |
| Direct InferenceBackbone=Qwen2.5-3b2025.09 | 16.7 | — | — | — | — | |
| Search-o1Backbone=Qwen2.5-1.5b2025.09 | 15.4 | — | — | — | — | |
| ReActBackbone=Qwen2.5-1.5b2025.09 | 15.1 | — | — | — | — | |
| Direct InferenceBackbone=Qwen2.5-1.5b2025.09 | 13.1 | — | — | — | — |