Belief assessment on misinformation on MISBELIEF Overall (Hard)
4.07Belief ScoreGPT-3.5-turbo
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-3.5-turboSetting=Round 32026.01 | 4.07 | |
| Qwen-turboSetting=Round 32026.01 | 4.05 | |
| GPT-5Setting=Round 32026.01 | 3.91 | |
| Qwen2.5-72BSetting=Round 32026.01 | 3.85 | |
| GPT-3.5-turboSetting=Round 12026.01 | 3.8 | |
| Qwen-turboSetting=Round 12026.01 | 3.71 | |
| Qwen2.5-32BSetting=Round 32026.01 | 3.69 | |
| Qwen2.5-72BSetting=Round 12026.01 | 3.69 | |
| GPT-5Setting=Round 12026.01 | 3.57 | |
| Qwen2.5-32BSetting=Round 12026.01 | 3.55 | |
| Llama3-8BSetting=Round 32026.01 | 3.39 | |
| Qwen-turbo (w/o reasoning)Setting=Round 32026.01 | 3.36 | |
| Llama3-8BSetting=Round 12026.01 | 3.15 | |
| Qwen-turbo (w/o reasoning)Setting=Round 12026.01 | 3.08 | |
| Qwen2.5-72BSetting=Baseline2026.01 | 2.68 | |
| Qwen2.5-72BSetting=Original2026.01 | 2.56 | |
| GPT-3.5-turboSetting=Original2026.01 | 2.39 | |
| GPT-3.5-turboSetting=Baseline2026.01 | 2.27 | |
| Qwen-turbo (w/o reasoning)Setting=Baseline2026.01 | 2.23 | |
| Qwen-turboSetting=Baseline2026.01 | 2.15 | |
| Qwen-turbo (w/o reasoning)Setting=Original2026.01 | 2.09 | |
| Qwen-turboSetting=Original2026.01 | 2.03 | |
| Qwen2.5-32BSetting=Baseline2026.01 | 2.02 | |
| Llama3-8BSetting=Original2026.01 | 2 | |
| GPT-5Setting=Original2026.01 | 1.94 | |
| Qwen2.5-32BSetting=Original2026.01 | 1.9 | |
| Llama3-8BSetting=Baseline2026.01 | 1.79 | |
| GPT-5Setting=Baseline2026.01 | 1.72 |