Multi-hop Question Answering on HotpotQA Full
86.1C (Correctness)FaithRL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| FaithRLBackbone=Qwen2.5-7B-Instruct2026.02 | 86.1 | 8 | 56 | |
| FaithRLBackbone=Llama3.1-8B-Instruct2026.02 | 85.5 | 11.4 | 64.1 | |
| TruthRLBackbone=Qwen2.5-7B-Instruct2026.02 | 85.1 | 10.2 | 46.7 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 84.2 | 14.8 | 28.4 | |
| KnowRLBackbone=Llama3.1-8B-Instruct2026.02 | 81.9 | 16.7 | 50.5 | |
| KnowRLBackbone=Qwen2.5-7B-Instruct2026.02 | 79.7 | 18.9 | 8.5 | |
| FSPOBackbone=Llama3.1-8B-Instruct2026.02 | 78.3 | 14 | 52 | |
| TruthRLBackbone=Llama3.1-8B-Instruct2026.02 | 78.1 | 18 | 44.3 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.02 | 76.1 | 22.9 | 33.1 | |
| GRPO + CTSFBackbone=Qwen2.5-7B-Instruct2026.02 | 76.1 | 15.3 | 18.5 | |
| PromptingBackbone=Qwen2.5-7B-Instruct2026.02 | 72.7 | 19.3 | 0 | |
| GRPO + CTSFBackbone=Llama3.1-8B-Instruct2026.02 | 68 | 28.3 | 14.8 | |
| FSPOBackbone=Qwen2.5-7B-Instruct2026.02 | 67.2 | 26.1 | -31.1 | |
| RLCRBackbone=Qwen2.5-7B-Instruct2026.02 | 67.1 | 29.7 | -44.8 | |
| CTSFBackbone=Llama3.1-8B-Instruct2026.02 | 66.6 | 10.8 | 46.3 | |
| R-TuningBackbone=Qwen2.5-7B-Instruct2026.02 | 64.8 | 15.2 | 7.5 | |
| CRaFTBackbone=Qwen2.5-7B-Instruct2026.02 | 64.5 | 10.3 | 25.7 | |
| R-TuningBackbone=Llama3.1-8B-Instruct2026.02 | 64.2 | 10.9 | 43.7 | |
| PromptingBackbone=Llama3.1-8B-Instruct2026.02 | 63.7 | 33.9 | 0 | |
| CTSFBackbone=Qwen2.5-7B-Instruct2026.02 | 63.3 | 11.4 | 20.4 | |
| CRaFTBackbone=Llama3.1-8B-Instruct2026.02 | 63 | 10 | 44.2 | |
| RLCRBackbone=Llama3.1-8B-Instruct2026.02 | 59.3 | 40 | -15.9 |