Early Rumor Detection on Twitter-COVID-19 (test)
58.6Macro F1Ours (w/ ChatGPT)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Ours (w/ ChatGPT)Training Dataset=Twitter-COVID-19, Backbone=ChatGPT2025.12 | 58.6 | 36.6 | |
| Ours (w/ ChatGPT)Training Dataset=TWITTER, Backbone=ChatGPT2025.12 | 54.6 | 43.4 | |
| Ours (w/ Llama3)Training Dataset=Twitter-COVID-19, Backbone=Llama32025.12 | 54.4 | 84.6 | |
| HEARDTraining Dataset=Twitter-COVID-192025.12 | 53 | 17.5 | |
| ERDTraining Dataset=Twitter-COVID-192025.12 | 52.8 | 100 | |
| CEDTraining Dataset=Twitter-COVID-192025.12 | 52.4 | 42.1 | |
| Ours (w/ ChatGPT)Training Dataset=PHEME, Backbone=ChatGPT2025.12 | 52.1 | 1.8 | |
| Ours (w/ Mistral)Training Dataset=Twitter-COVID-19, Backbone=Mistral2025.12 | 51.1 | 18.4 | |
| Ours (w/ Mistral)Training Dataset=TWITTER, Backbone=Mistral2025.12 | 49.9 | 2 | |
| Ours (w/ Mistral)Training Dataset=PHEME, Backbone=Mistral2025.12 | 49.7 | 3 | |
| CEDTraining Dataset=TWITTER2025.12 | 48.2 | 37.8 | |
| HEARDTraining Dataset=TWITTER2025.12 | 48 | 64.1 | |
| ERDTraining Dataset=TWITTER2025.12 | 47.3 | 100 | |
| Ours (w/ Llama3)Training Dataset=TWITTER, Backbone=Llama32025.12 | 46.1 | 18.6 | |
| Ours (w/ Llama3)Training Dataset=PHEME, Backbone=Llama32025.12 | 44.2 | 8.6 | |
| CEDTraining Dataset=PHEME2025.12 | 39.4 | 31.1 | |
| HEARDTraining Dataset=PHEME2025.12 | 34.1 | 2.5 | |
| ERDTraining Dataset=PHEME2025.12 | 31.6 | 100 |