Knowledge-Intensive Reasoning on MuSiQue (F1 score)
34.8F1 ScoreLlama3.1-8B + ARPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Llama3.1-8B + ARPOBase Model=Llama3.1-8B, Algorithm=ARPO2025.12 | 34.8 | — | — | |
| EAPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 33.1 | 22 | 2.46 | |
| EAPOBackbone=Llama3.1-8B-Instruct2026.06 | 32.8 | 16 | 2.58 | |
| GRPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 32.1 | 17.5 | 3.1 | |
| Qwen2.5-7B + ARPOBase Model=Qwen2.5-7B, Algorithm=ARPO2025.12 | 31.1 | — | — | |
| Llama3.1-8B + GRPOBase Model=Llama3.1-8B, Algorithm=GRPO2025.12 | 31 | — | — | |
| Soft-NBCEMem=O(L^2/n), zero-shot=false, distillation=true2026.05 | 31 | — | — | |
| Reinforce++Backbone Model=Qwen2.5-7B-Instruct2026.06 | 30.7 | 15.4 | 2.26 | |
| Qwen2.5-7B + GRPOBase Model=Qwen2.5-7B, Algorithm=GRPO2025.12 | 30.6 | — | — | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.06 | 30.6 | 16.7 | 3.07 | |
| Reinforce++Backbone=Llama3.1-8B-Instruct2026.06 | 30.2 | 15.9 | 2.37 | |
| Qwen2.5-3B + DAPOBase Model=Qwen2.5-3B, Algorithm=DAPO2025.12 | 30 | — | — | |
| Llama3.1-8B + Reinforce ++Base Model=Llama3.1-8B, Algorithm=Reinforce ++2025.12 | 29.9 | — | — | |
| Llama3.1-8B + DAPOBase Model=Llama3.1-8B, Algorithm=DAPO2025.12 | 29.2 | — | — | |
| Qwen2.5-3B + ARPOBase Model=Qwen2.5-3B, Algorithm=ARPO2025.12 | 28.7 | — | — | |
| Qwen2.5-7B + DAPOBase Model=Qwen2.5-7B, Algorithm=DAPO2025.12 | 28.6 | — | — | |
| Soft-NBCEMem=O(L^2/n), zero-shot=true, distillation=false2026.05 | 28.3 | — | — | |
| Qwen2.5-3B + Reinforce ++Base Model=Qwen2.5-3B, Algorithm=Reinforce ++2025.12 | 27.9 | — | — | |
| Vanilla NBCEMem=O(L^2/n)2026.05 | 27.5 | — | — | |
| Qwen2.5-7B + Reinforce ++Base Model=Qwen2.5-7B, Algorithm=Reinforce ++2025.12 | 25.2 | — | — | |
| AEPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 25.1 | 13.5 | 4.71 | |
| Qwen2.5-3B + GRPOBase Model=Qwen2.5-3B, Algorithm=GRPO2025.12 | 24.7 | — | — | |
| EAPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 23.4 | 17.5 | 2.26 | |
| ARPOBackbone Model=Qwen2.5-7B-Instruct2026.06 | 22.5 | 12 | 2.33 | |
| PCWMem=O(L^2/n)2026.05 | 21.2 | — | — | |
| Truncated (8K)Mem=O(L^2)2026.05 | 20.9 | — | — | |
| ARPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 19.4 | 11.5 | 2.62 | |
| TIRBackbone=Llama3.1-8B-Instruct2026.06 | 17.8 | 9.7 | 2.67 | |
| GRPOBackbone Model=Qwen2.5-3B-Instruct2026.06 | 17.7 | 9.8 | 2.48 | |
| ToolStarBackbone Model=Qwen2.5-7B-Instruct2026.06 | 16.8 | 11 | 4.07 | |
| Reinforce++Backbone Model=Qwen2.5-3B-Instruct2026.06 | 16 | 7.8 | 2.51 | |
| ToolStarBackbone Model=Qwen2.5-3B-Instruct2026.06 | 15.7 | 8.5 | 2.52 | |
| Llama3.1-8B + TIR PromptingBase Model=Llama3.1-8B, Algorithm=TIR Prompting2025.12 | 15.5 | — | — | |
| Llama3.1-8BBase Model=Llama3.1-8B, Algorithm=Direct Reasoning2025.12 | 10.4 | — | — | |
| BaseBackbone=Llama3.1-8B-Instruct2026.06 | 9.8 | 7.4 | — | |
| Qwen2.5-7B + TIR PromptingBase Model=Qwen2.5-7B, Algorithm=TIR Prompting2025.12 | 9.5 | — | — | |
| TIRBackbone Model=Qwen2.5-7B-Instruct2026.06 | 7.7 | 2.5 | 2.56 | |
| Qwen2.5-7BBase Model=Qwen2.5-7B, Algorithm=Direct Reasoning2025.12 | 6.6 | — | — | |
| BaseBackbone Model=Qwen2.5-7B-Instruct2026.06 | 6.5 | 2.5 | — | |
| Qwen2.5-3B + TIR PromptingBase Model=Qwen2.5-3B, Algorithm=TIR Prompting2025.12 | 6.1 | — | — | |
| TIRBackbone Model=Qwen2.5-3B-Instruct2026.06 | 6.1 | 3.2 | 1.59 | |
| Qwen2.5-3BBase Model=Qwen2.5-3B, Algorithm=Direct Reasoning2025.12 | 3.6 | — | — | |
| BaseBackbone Model=Qwen2.5-3B-Instruct2026.06 | 3.6 | 0.5 | — |