Multi-hop Question Answering on HotpotQA (LLM Judge)
78.07LLM Judge ScoreDeepSeek-V4-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-V4-FlashBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 78.07 | |
| Qwen3-1.7B-SFTBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 77.88 | |
| Qwen3-1.7B-SFTBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 75.6 | |
| DeepSeek-V4-FlashBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 75.29 | |
| Qwen3-1.7BBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 72.27 | |
| Qwen3-1.7BBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 70.89 |