Multi-hop Question Answering on 2WikiMultiHopQA Full
87.5Accuracy (C)FaithRL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FaithRLBackbone=Llama3.1-8B-Instruct2026.02 | 87.5 | 9.1 | 61.7 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.02 | 86.2 | 12.2 | 51.6 | |
| FaithRLBackbone=Qwen2.5-7B-Instruct2026.02 | 85.4 | 7.9 | 42.3 | |
| TruthRLBackbone=Llama3.1-8B-Instruct2026.02 | 85.3 | 11.6 | 52.4 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 84.9 | 13.1 | 13.4 | |
| TruthRLBackbone=Qwen2.5-7B-Instruct2026.02 | 83.8 | 9.8 | 30.3 | |
| KnowRLBackbone=Llama3.1-8B-Instruct2026.02 | 78.8 | 19.5 | 23.5 | |
| FSPOBackbone=Llama3.1-8B-Instruct2026.02 | 77.7 | 9.2 | 51.6 | |
| KnowRLBackbone=Qwen2.5-7B-Instruct2026.02 | 73.8 | 23.9 | -5.7 | |
| FSPOBackbone=Qwen2.5-7B-Instruct2026.02 | 72.4 | 14.9 | -8.9 | |
| PromptingBackbone=Qwen2.5-7B-Instruct2026.02 | 71.5 | 13.1 | 0 | |
| PromptingBackbone=Llama3.1-8B-Instruct2026.02 | 69.2 | 24.4 | 0 | |
| RLCRBackbone=Qwen2.5-7B-Instruct2026.02 | 64.9 | 27 | -82.5 | |
| GRPO + CTSFBackbone=Qwen2.5-7B-Instruct2026.02 | 64.8 | 29.2 | -94.6 | |
| CTSFBackbone=Llama3.1-8B-Instruct2026.02 | 63.5 | 14.8 | 21.5 | |
| RLCRBackbone=Llama3.1-8B-Instruct2026.02 | 60.6 | 35.8 | -40.9 | |
| R-TuningBackbone=Qwen2.5-7B-Instruct2026.02 | 59.2 | 21.9 | -60.3 | |
| R-TuningBackbone=Llama3.1-8B-Instruct2026.02 | 56.9 | 12.7 | 20.9 | |
| CTSFBackbone=Qwen2.5-7B-Instruct2026.02 | 55.7 | 24.1 | -75.8 | |
| CRaFTBackbone=Qwen2.5-7B-Instruct2026.02 | 51.3 | 10.9 | -8.2 | |
| GRPO + CTSFBackbone=Llama3.1-8B-Instruct2026.02 | 50.6 | 46.7 | -81.8 | |
| CRaFTBackbone=Llama3.1-8B-Instruct2026.02 | 49.1 | 14.9 | 6.8 |