Multi-hop Question Answering on MuSiQue (LLM Judge)
44.13LLM Judge ScoreQwen3-1.7B-SFT
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-1.7B-SFTBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 44.13 | |
| DeepSeek-V4-FlashBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 43.97 | |
| DeepSeek-V4-FlashBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 41.3 | |
| Qwen3-1.7B-SFTBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 41.09 | |
| Qwen3-1.7BBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 38.2 | |
| Qwen3-1.7BBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 35.36 |