Knowledge-Intensive Reasoning on Bamboogle (F1 score)
73.8F1Llama3.1-8B + ARPO
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Llama3.1-8B + ARPOBase Model=Llama3.1-8B, Algorithm=ARPO2025.12 | 73.8 | — | — | — | |
| Qwen2.5-7B + ARPOBase Model=Qwen2.5-7B, Algorithm=ARPO2025.12 | 71.5 | — | — | — | |
| Llama3.1-8B + Reinforce ++Base Model=Llama3.1-8B, Algorithm=Reinforce ++2025.12 | 69.1 | — | — | — | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, Algorithm=GRPO2025.12 | 68.4 | — | — | — | |
| Llama3.1-8B + GRPOBase Model=Llama3.1-8B, Algorithm=GRPO2025.12 | 68.2 | — | — | — | |
| Llama3.1-8B + DAPOBase Model=Llama3.1-8B, Algorithm=DAPO2025.12 | 67.3 | — | — | — | |
| Qwen2.5-3B + ARPOBase Model=Qwen2.5-3B, Algorithm=ARPO2025.12 | 66.8 | — | — | — | |
| Qwen2.5-3B + Reinforce ++Base Model=Qwen2.5-3B, Algorithm=Reinforce ++2025.12 | 65.7 | — | — | — | |
| Qwen2.5-7B + DAPOBase Model=Qwen2.5-7B, Algorithm=DAPO2025.12 | 65.5 | — | — | — | |
| Qwen2.5-3B + GRPOBase Model=Qwen2.5-3B, Algorithm=GRPO2025.12 | 65.2 | — | — | — | |
| Qwen2.5-7B + Reinforce ++Base Model=Qwen2.5-7B, Algorithm=Reinforce ++2025.12 | 64.9 | — | — | — | |
| Qwen2.5-3B + DAPOBase Model=Qwen2.5-3B, Algorithm=DAPO2025.12 | 64.8 | — | — | — | |
| EAPOBackbone=Llama3.1-8B-Instruct2026.06 | 61.7 | 47.9 | 2.19 | — | |
| Llama3.1-8B + TIR PromptingBase Model=Llama3.1-8B, Algorithm=TIR Prompting2025.12 | 58.4 | — | — | — | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | 58.4 | 23.7 | 2.2 | — | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | 57.4 | 42.8 | 2.94 | — | |
| Llama3.1-8BBase Model=Llama3.1-8B, Algorithm=Direct Reasoning2025.12 | 40 | — | — | — | |
| TIRBackbone=Llama3.1-8B-Instruct2026.06 | 30.6 | 15.8 | 2.42 | — | |
| BaseBackbone=Llama3.1-8B-Instruct2026.06 | 26.7 | 12.5 | — | — | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, Algorithm=Direct Reasoning2025.12 | 24 | — | — | — | |
| Qwen2.5-7B + TIR PromptingBase Model=Qwen2.5-7B, Algorithm=TIR Prompting2025.12 | 23.6 | — | — | — | |
| Qwen2.5-3B + TIR PromptingBase Model=Qwen2.5-3B, Algorithm=TIR Prompting2025.12 | 16.4 | — | — | — | |
| Qwen2.5-3BBase Model=Qwen2.5-3B, Algorithm=Direct Reasoning2025.12 | 11.7 | — | — | — | |
| APPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 76.8 | |
| APPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 77.6 | |
| ARPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 72.8 | |
| ARPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 71.5 | |
| CISPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 71.8 | |
| CISPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 70.2 | |
| DAPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 67.3 | |
| DAPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 65.5 | |
| GIGPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 72.1 | |
| GIGPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 70.1 | |
| GPPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 71.9 | |
| GPPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 72.4 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 68.2 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 68.4 | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 69.1 | |
| Reinforce++Backbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 64.9 | |
| TIR PromptingBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 58.4 | |
| TIR PromptingBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 23.6 | |
| Zero-shotBackbone=Llama3.1-8B-Instruct2026.06 | — | — | — | 40 | |
| Zero-shotBackbone=Qwen2.5-7B-Instruct2026.06 | — | — | — | 24 |