Multi-hop Question Answering on MuSiQue Full
80.1C ScoreTruthRL
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| TruthRLBackbone=Llama3.1-8B-Instruct2026.02 | 80.1 | 9.7 | 64.1 | |
| FaithRLBackbone=Llama3.1-8B-Instruct2026.02 | 80 | 8.8 | 65.5 | |
| GRPOBackbone=Llama3.1-8B-Instruct2026.02 | 79.7 | 13.1 | 58.1 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 79.4 | 15.3 | 37 | |
| TruthRLBackbone=Qwen2.5-7B-Instruct2026.02 | 77.7 | 8 | 55.5 | |
| FaithRLBackbone=Qwen2.5-7B-Instruct2026.02 | 75.7 | 5.9 | 59.3 | |
| KnowRLBackbone=Llama3.1-8B-Instruct2026.02 | 75.3 | 16.9 | 47.4 | |
| KnowRLBackbone=Qwen2.5-7B-Instruct2026.02 | 73.8 | 17.6 | 9.9 | |
| R-TuningBackbone=Llama3.1-8B-Instruct2026.02 | 65.8 | 12.4 | 45.3 | |
| R-TuningBackbone=Qwen2.5-7B-Instruct2026.02 | 65.5 | 13.8 | 27.2 | |
| GRPO + CTSFBackbone=Qwen2.5-7B-Instruct2026.02 | 63.5 | 13.2 | 26.9 | |
| FSPOBackbone=Llama3.1-8B-Instruct2026.02 | 63.2 | 12.4 | 42.7 | |
| CRaFTBackbone=Llama3.1-8B-Instruct2026.02 | 59.2 | 6.2 | 49 | |
| PromptingBackbone=Qwen2.5-7B-Instruct2026.02 | 59.2 | 16.3 | 0 | |
| GRPO + CTSFBackbone=Llama3.1-8B-Instruct2026.02 | 58.8 | 30.7 | 8.2 | |
| FSPOBackbone=Qwen2.5-7B-Instruct2026.02 | 58.6 | 13.9 | 8.1 | |
| CRaFTBackbone=Qwen2.5-7B-Instruct2026.02 | 58.2 | 5.3 | 43.5 | |
| CTSFBackbone=Llama3.1-8B-Instruct2026.02 | 56.8 | 9 | 42 | |
| PromptingBackbone=Llama3.1-8B-Instruct2026.02 | 54.1 | 32.8 | 0 | |
| CTSFBackbone=Qwen2.5-7B-Instruct2026.02 | 53.8 | 7.5 | 33 | |
| RLCRBackbone=Qwen2.5-7B-Instruct2026.02 | 52 | 29.1 | -53.7 | |
| RLCRBackbone=Llama3.1-8B-Instruct2026.02 | 50.6 | 41.5 | -17.8 |