Multi-Hop Question Answering on Multi-Hop QA Aggregate
45.3Average ScoreTree-GRPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Tree-GRPOBackbone=Qwen2.5-14b2025.09 | 45.3 | 8.4 | |
| GSPOBackbone=Qwen2.5-14b2025.09 | 44.2 | 5.7 | |
| GRPOBackbone=Qwen2.5-14b2025.09 | 41.8 | — | |
| Tree-GRPOBackbone=Qwen2.5-7b2025.09 | 37.8 | 3.9 | |
| Tree-GRPOBackbone=Qwen2.5-3b2025.09 | 36.8 | 16 | |
| Tree-GRPOBackbone=Llama3.2-3b2025.09 | 36.8 | 38 | |
| GRPOBackbone=Qwen2.5-7b2025.09 | 36.4 | — | |
| GSPOBackbone=Qwen2.5-7b2025.09 | 35.4 | -2.8 | |
| GSPOBackbone=Qwen2.5-3b2025.09 | 33.5 | 5.2 | |
| ReActBackbone=Qwen2.5-14b2025.09 | 32.8 | — | |
| GRPOBackbone=Qwen2.5-3b2025.09 | 31.8 | — | |
| GRPOBackbone=Llama3.2-3b2025.09 | 26.7 | — | |
| Search-o1Backbone=Qwen2.5-14b2025.09 | 23.6 | — | |
| GSPOBackbone=Llama3.2-3b2025.09 | 23.3 | -13 | |
| ReActBackbone=Qwen2.5-7b2025.09 | 23.3 | — | |
| Search-o1Backbone=Qwen2.5-7b2025.09 | 20.3 | — | |
| Tree-GRPOBackbone=Qwen2.5-1.5b2025.09 | 19.1 | 69 | |
| Search-o1Backbone=Qwen2.5-3b2025.09 | 17.9 | — | |
| Direct InferenceBackbone=Qwen2.5-14b2025.09 | 16.9 | — | |
| ReActBackbone=Qwen2.5-3b2025.09 | 15.8 | — | |
| Direct InferenceBackbone=Qwen2.5-7b2025.09 | 14.6 | — | |
| Search-o1Backbone=Llama3.2-3b2025.09 | 14.1 | — | |
| ReActBackbone=Llama3.2-3b2025.09 | 13.3 | — | |
| GSPOBackbone=Qwen2.5-1.5b2025.09 | 11.7 | 3.5 | |
| GRPOBackbone=Qwen2.5-1.5b2025.09 | 11.3 | — | |
| Direct InferenceBackbone=Qwen2.5-3b2025.09 | 10.9 | — | |
| Search-o1Backbone=Qwen2.5-1.5b2025.09 | 10 | — | |
| Direct InferenceBackbone=Llama3.2-3b2025.09 | 8 | — | |
| ReActBackbone=Qwen2.5-1.5b2025.09 | 7.1 | — | |
| Direct InferenceBackbone=Qwen2.5-1.5b2025.09 | 5.2 | — |