Belief assessment on misinformation on MISBELIEF Health domain Easy split
2.87Belief ScoreQwen2.5-72B
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-72BSetting=Round 32026.01 | 2.87 | |
| GPT-3.5-turboSetting=Round 32026.01 | 2.77 | |
| Qwen2.5-32BSetting=Round 32026.01 | 2.53 | |
| Qwen2.5-72BSetting=Round 12026.01 | 2.51 | |
| Qwen-turboSetting=Round 32026.01 | 2.48 | |
| GPT-5Setting=Round 32026.01 | 2.34 | |
| GPT-3.5-turboSetting=Round 12026.01 | 2.33 | |
| Llama3-8BSetting=Round 32026.01 | 2.3 | |
| Qwen2.5-32BSetting=Round 12026.01 | 2.21 | |
| Qwen-turbo (w/o reasoning)Setting=Round 32026.01 | 2.17 | |
| Qwen-turboSetting=Round 12026.01 | 2.11 | |
| Llama3-8BSetting=Round 12026.01 | 1.99 | |
| Qwen-turbo (w/o reasoning)Setting=Round 12026.01 | 1.94 | |
| GPT-5Setting=Round 12026.01 | 1.92 | |
| Qwen2.5-72BSetting=Baseline2026.01 | 1.56 | |
| Qwen2.5-72BSetting=Original2026.01 | 1.45 | |
| Qwen-turbo (w/o reasoning)Setting=Baseline2026.01 | 1.38 | |
| GPT-3.5-turboSetting=Baseline2026.01 | 1.32 | |
| Qwen-turbo (w/o reasoning)Setting=Original2026.01 | 1.26 | |
| GPT-3.5-turboSetting=Original2026.01 | 1.17 | |
| Qwen-turboSetting=Original2026.01 | 1.16 | |
| Qwen-turboSetting=Baseline2026.01 | 1.16 | |
| Llama3-8BSetting=Original2026.01 | 1.1 | |
| Llama3-8BSetting=Baseline2026.01 | 1.1 | |
| GPT-5Setting=Baseline2026.01 | 1.09 | |
| Qwen2.5-32BSetting=Original2026.01 | 1.09 | |
| GPT-5Setting=Original2026.01 | 1.07 | |
| Qwen2.5-32BSetting=Baseline2026.01 | 1.06 |