Multi-hop Question Answering on Bamboogle (LLM Judge)
67.89LLM Judge ScoreDeepSeek-V4-Flash
Evaluation Results
| Method | Links | |
|---|---|---|
| DeepSeek-V4-FlashBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 67.89 | |
| Qwen3-1.7B-SFTBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 66.4 | |
| Qwen3-1.7B-SFTBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 64.8 | |
| DeepSeek-V4-FlashBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 63.3 | |
| Qwen3-1.7BBackbone=GLM-5.1, Evaluation Protocol=mean@42026.07 | 56.88 | |
| Qwen3-1.7BBackbone=DeepSeek-V4-Flash, Evaluation Protocol=mean@42026.07 | 54.13 |