Knowledge-Intensive Reasoning on HotpotQA (F1 score)
0.654F1 ScoreLlama3.1-8B + ARPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Llama3.1-8B + ARPOBase Model=Llama3.1-8B, Algorithm=ARPO2025.12 | 0.654 | — | — | — | |
| EAPOBackbone=Llama3.1-8B-Instruct2026.06 | 0.624 | 46.7 | 1.98 | — | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | 0.592 | 43.9 | 1.97 | — | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, Algorithm=GRPO2025.12 | 0.59 | — | — | — | |
| Qwen2.5-7B + ARPOBase Model=Qwen2.5-7B, Algorithm=ARPO2025.12 | 0.588 | — | — | — | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | 0.588 | 44.3 | 2.89 | — | |
| Qwen2.5-3B + ARPOBase Model=Qwen2.5-3B, Algorithm=ARPO2025.12 | 0.585 | — | — | — | |
| Llama3.1-8B + GRPOBase Model=Llama3.1-8B, Algorithm=GRPO2025.12 | 0.578 | — | — | — | |
| Qwen2.5-7B + DAPOBase Model=Qwen2.5-7B, Algorithm=DAPO2025.12 | 0.577 | — | — | — | |
| Llama3.1-8B + Reinforce ++Base Model=Llama3.1-8B, Algorithm=Reinforce ++2025.12 | 0.571 | — | — | — | |
| Llama3.1-8B + DAPOBase Model=Llama3.1-8B, Algorithm=DAPO2025.12 | 0.566 | — | — | — | |
| Qwen2.5-3B + GRPOBase Model=Qwen2.5-3B, Algorithm=GRPO2025.12 | 0.565 | — | — | — | |
| Qwen2.5-3B + Reinforce ++Base Model=Qwen2.5-3B, Algorithm=Reinforce ++2025.12 | 0.559 | — | — | — | |
| Qwen2.5-7B + Reinforce ++Base Model=Qwen2.5-7B, Algorithm=Reinforce ++2025.12 | 0.551 | — | — | — | |
| Qwen2.5-3B + DAPOBase Model=Qwen2.5-3B, Algorithm=DAPO2025.12 | 0.548 | — | — | — | |
| GRPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 0.544 | 42.5 | 2.62 | — | |
| EAPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 0.541 | 42.5 | 1.99 | — | |
| Reinforce++Backbone Model=Qwen2.5-7B-Instruct2026.06 | 0.506 | 40 | 1.81 | — | |
| Llama3.1-8B + TIR PromptingBase Model=Llama3.1-8B, Algorithm=TIR Prompting2025.12 | 0.485 | — | — | — | |
| AEPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 0.477 | 36 | 4.26 | — | |
| EAPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 0.465 | 38.5 | 1.84 | — | |
| ARPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 0.457 | 34.5 | 1.93 | — | |
| ToolStarBackbone Model=Qwen2.5-7B-Instruct2026.06 | 0.424 | 32.5 | 3.82 | — | |
| Reinforce++Backbone Model=Qwen2.5-3B-Instruct2026.06 | 0.423 | 37.5 | 2.99 | — | |
| ARPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 0.412 | 32.5 | 2.28 | — | |
| GRPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 0.407 | 31.8 | 2.7 | — | |
| ToolStarBackbone Model=Qwen2.5-3B-Instruct2026.06 | 0.385 | 30 | 2.29 | — | |
| TIRBackbone=Llama3.1-8B-Instruct2026.06 | 0.307 | 29.8 | 3.12 | — | |
| Llama3.1-8BBase Model=Llama3.1-8B, Algorithm=Direct Reasoning2025.12 | 0.243 | — | — | — | |
| EAPO2025.09 | 0.2375 | — | — | — | |
| BaseBackbone=Llama3.1-8B-Instruct2026.06 | 0.223 | 7.2 | — | — | |
| Self-Exploratory RL2025.09 | 0.2146 | — | — | — | |
| Qwen2.5-3B + TIR PromptingBase Model=Qwen2.5-3B, Algorithm=TIR Prompting2025.12 | 0.154 | — | — | — | |
| TIRBackbone Model=Qwen2.5-3B-Instruct2026.06 | 0.154 | 10.4 | 1.44 | — | |
| Qwen2.5-7B + TIR PromptingBase Model=Qwen2.5-7B, Algorithm=TIR Prompting2025.12 | 0.148 | — | — | — | |
| TIRBackbone Model=Qwen2.5-7B-Instruct2026.06 | 0.138 | 6.7 | 2.37 | — | |
| Base Model2025.09 | 0.1286 | — | — | — | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, Algorithm=Direct Reasoning2025.12 | 0.122 | — | — | — | |
| BaseBackbone Model=Qwen2.5-7B-Instruct2026.06 | 0.106 | 5.6 | — | — | |
| Qwen2.5-3BBase Model=Qwen2.5-3B, Algorithm=Direct Reasoning2025.12 | 0.097 | — | — | — | |
| BaseBackbone Model=Qwen2.5-3B-Instruct2026.06 | 0.097 | 7.2 | — | — | |
| APPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 65.4 | |
| APPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 66.5 | |
| ARPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 65.4 | |
| ARPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 58.8 | |
| CISPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 57.3 | |
| CISPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 59.3 | |
| DAPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 56.6 | |
| DAPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 57.7 | |
| GIGPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 61.8 | |
| GIGPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 58.1 | |
| GPPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 61.8 | |
| GPPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 60.7 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 57.8 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 59 | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 57.1 | |
| Reinforce++Backbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 55.1 | |
| TIR PromptingBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 48.5 | |
| TIR PromptingBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 14.8 | |
| Zero-shotBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 24.3 | |
| Zero-shotBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 12.2 |