Multi-Hop Question Answering on HotpotQA (F1 and LasJ)
64.5F1 ScoreBranPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BranPOBackbone=Qwen3-4B-Instruct-2507, Training interaction limit=8, Evaluation interaction limit=162026.02 | 64.5 | 77.8 | |
| BranPOBackbone=Qwen2.5-7B-Instruct, Training interaction limit=8, Evaluation interaction limit=162026.02 | 62.7 | 75.2 | |
| CARLModel=4B Reasoning, Max actions=322025.12 | 62.6 | 66.9 | |
| GRPOBackbone=Qwen3-4B-Instruct-2507, Training interaction limit=8, Evaluation interaction limit=162026.02 | 61.4 | 74.5 | |
| TreeRLModel=4B Reasoning, Max actions=102025.12 | 61.1 | 64.3 | |
| BranPOBackbone=Qwen2.5-7B-Instruct2026.02 | 60.9 | 73 | |
| ARPOModel=4B Reasoning, Max actions=102025.12 | 60.9 | 65.3 | |
| CARLModel=4B Reasoning, Max actions=102025.12 | 60.8 | 65.1 | |
| GRPOModel=4B Reasoning, Max actions=102025.12 | 60.7 | 64.4 | |
| GRPOBackbone=Qwen2.5-7B-Instruct, Training interaction limit=8, Evaluation interaction limit=162026.02 | 60.4 | 71.9 | |
| BranPOBackbone=Qwen3-4B-Instruct-25072026.02 | 59.8 | 72.6 | |
| TreeRPOModel=4B Reasoning, Max actions=102025.12 | 59.6 | 64.1 | |
| GRPOModel=4B Reasoning, Max actions=322025.12 | 59.3 | 63.1 | |
| CARL-LiteModel=4B Reasoning, Max actions=102025.12 | 59.2 | 62.9 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 58.6 | 71.7 | |
| Tree-GRPOBackbone=Qwen3-4B-Instruct-2507, Training interaction limit=8, Evaluation interaction limit=162026.02 | 58.4 | 71.2 | |
| Tree-GRPOBackbone=Qwen2.5-7B-Instruct, Training interaction limit=8, Evaluation interaction limit=162026.02 | 58.3 | 69.4 | |
| GRPOBackbone=Qwen3-4B-Instruct-25072026.02 | 58.1 | 69.4 | |
| GiGPOBackbone=Qwen2.5-7B-Instruct2026.02 | 56.9 | 67.3 | |
| Tree-GRPOBackbone=Qwen3-4B-Instruct-25072026.02 | 56.8 | 69.7 | |
| Tree-GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 56.7 | 71.7 | |
| GiGPOBackbone=Qwen3-4B-Instruct-25072026.02 | 56.3 | 69.2 | |
| SFTBackbone=Qwen3-4B-Instruct-25072026.02 | 54.9 | 68.7 | |
| SFTBackbone=Qwen2.5-7B-Instruct2026.02 | 54.3 | 65 | |
| CARLModel=7B Non-Reasoning, Max actions=322025.12 | 51.9 | 54.6 | |
| GRPOModel=7B Non-Reasoning, Max actions=322025.12 | 47 | 48.7 | |
| CARLModel=3B Non-Reasoning, Max actions=322025.12 | 34.9 | 35.8 | |
| GRPOModel=3B Non-Reasoning, Max actions=322025.12 | 33.7 | 34.8 | |
| Zero-ShotModel=4B Reasoning, Max actions=102025.12 | 31.9 | 47.4 | |
| Zero-ShotModel=7B Non-Reasoning, Max actions=322025.12 | 17.4 | 36.7 | |
| Zero-ShotModel=3B Non-Reasoning, Max actions=322025.12 | 16.4 | 26.8 |