Hallucination Evaluation on TBH (ToolBench Hallucination)
61.6TBH ScoreRUBAS
Evaluation Results
| Method | Links | |
|---|---|---|
| RUBASBase Model=Qwen3-8B, Training Strategy=+ RUBAS2026.06 | 61.6 | |
| RUBASBase Model=Qwen3-14B, Training Strategy=+ RUBAS2026.06 | 58.6 | |
| GuardModelBase Model=Qwen3-14B, Training Strategy=+ GuardModel2026.06 | 57.3 | |
| RuleBase Model=Qwen3-14B, Training Strategy=+ Rule2026.06 | 56.7 | |
| GuardModelBase Model=Qwen3-8B, Training Strategy=+ GuardModel2026.06 | 56.3 | |
| RuleBase Model=Qwen3-8B, Training Strategy=+ Rule2026.06 | 53.5 | |
| Qwen3-14BBase Model=Qwen3-14B, Training Strategy=Base2026.06 | 42.1 | |
| Qwen3-8BBase Model=Qwen3-8B, Training Strategy=Base2026.06 | 33.6 | |
| DPOBase Model=Qwen3-8B, Training Strategy=+ DPO2026.06 | 29.8 | |
| DPOBase Model=Qwen3-14B, Training Strategy=+ DPO, Training Status=Failure (†)2026.06 | 24.3 | |
| SFTBase Model=Qwen3-14B, Training Strategy=+ SFT2026.06 | 23.2 | |
| RUBASBase Model=GLM-4.7-Flash, Training Strategy=+ RUBAS2026.06 | 18.5 | |
| SFTBase Model=Qwen3-8B, Training Strategy=+ SFT2026.06 | 17.4 | |
| SFTBase Model=GLM-4.7-Flash, Training Strategy=+ SFT2026.06 | 10.5 | |
| RuleBase Model=GLM-4.7-Flash, Training Strategy=+ Rule, Training Status=Failure (†)2026.06 | 9.7 | |
| GLM-4.7-FlashBase Model=GLM-4.7-Flash, Training Strategy=Base2026.06 | 8.3 | |
| GuardModelBase Model=GLM-4.7-Flash, Training Strategy=+ GuardModel, Training Status=Failure (†)2026.06 | 6.4 | |
| DPOBase Model=GLM-4.7-Flash, Training Strategy=+ DPO, Training Status=Failure (†)2026.06 | 0.9 |