Belief assessment on misinformation on MISBELIEF Overall (Medium)
3.88Belief ScoreGPT-3.5-turbo
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-3.5-turboSetting=Round 32026.01 | 3.88 | |
| Qwen-turboSetting=Round 32026.01 | 3.87 | |
| Qwen2.5-72BSetting=Round 32026.01 | 3.72 | |
| GPT-5Setting=Round 32026.01 | 3.65 | |
| GPT-3.5-turboSetting=Round 12026.01 | 3.6 | |
| Qwen2.5-32BSetting=Round 32026.01 | 3.58 | |
| Qwen-turboSetting=Round 12026.01 | 3.54 | |
| Qwen2.5-72BSetting=Round 12026.01 | 3.53 | |
| Qwen2.5-32BSetting=Round 12026.01 | 3.36 | |
| Llama3-8BSetting=Round 32026.01 | 3.34 | |
| GPT-5Setting=Round 12026.01 | 3.28 | |
| Qwen-turbo (w/o reasoning)Setting=Round 32026.01 | 3.17 | |
| Llama3-8BSetting=Round 12026.01 | 3.01 | |
| Qwen-turbo (w/o reasoning)Setting=Round 12026.01 | 2.89 | |
| Qwen2.5-72BSetting=Baseline2026.01 | 2.5 | |
| Qwen2.5-72BSetting=Original2026.01 | 2.41 | |
| GPT-3.5-turboSetting=Original2026.01 | 2.17 | |
| GPT-3.5-turboSetting=Baseline2026.01 | 2.17 | |
| Qwen-turbo (w/o reasoning)Setting=Baseline2026.01 | 2.13 | |
| Qwen-turboSetting=Baseline2026.01 | 2.06 | |
| Qwen-turbo (w/o reasoning)Setting=Original2026.01 | 1.97 | |
| Qwen-turboSetting=Original2026.01 | 1.94 | |
| Qwen2.5-32BSetting=Baseline2026.01 | 1.88 | |
| Qwen2.5-32BSetting=Original2026.01 | 1.83 | |
| Llama3-8BSetting=Original2026.01 | 1.8 | |
| GPT-5Setting=Original2026.01 | 1.7 | |
| Llama3-8BSetting=Baseline2026.01 | 1.69 | |
| GPT-5Setting=Baseline2026.01 | 1.61 |