Document-level classification on Social Media Posts
84.3AccuracyGPT-5.4 (Proposed Taxonomy)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-5.4 (Proposed Taxonomy)Model=GPT-5.4, Variant=Proposed Taxonomy2026.06 | 84.3 | 84.6 | 83.6 | 83.9 | |
| Sonnet 4.6 (Proposed Taxonomy)Model=Sonnet 4.6, Variant=Proposed Taxonomy2026.06 | 83.2 | 83.1 | 82.9 | 83 | |
| DeepSeek V4 (Proposed Taxonomy)Model=DeepSeek V4, Variant=Proposed Taxonomy2026.06 | 82.8 | 83.4 | 81.9 | 82.2 | |
| Sonnet 4.6 (Leal-Arenas & Corizzo)Model=Sonnet 4.6, Variant=Leal-Arenas & Corizzo2026.06 | 82.3 | 82.8 | 81.4 | 81.7 | |
| Sonnet 4.6 (No Taxonomy)Model=Sonnet 4.6, Variant=No Taxonomy2026.06 | 82.2 | 83 | 81.2 | 81.6 | |
| Sonnet 4.6 (Fillies & Paschke)Model=Sonnet 4.6, Variant=Fillies & Paschke2026.06 | 81.7 | 82.1 | 80.9 | 81.2 | |
| DeepSeek V4 (Fillies & Paschke)Model=DeepSeek V4, Variant=Fillies & Paschke2026.06 | 80.7 | 81.6 | 79.6 | 80 | |
| Sonnet 4.6 (Calhoun & Fawcett)Model=Sonnet 4.6, Variant=Calhoun & Fawcett2026.06 | 80.6 | 81.7 | 79.4 | 79.8 | |
| GPT-5.4 (Leal-Arenas & Corizzo)Model=GPT-5.4, Variant=Leal-Arenas & Corizzo2026.06 | 80.5 | 82.3 | 79.2 | 79.6 | |
| DeepSeek V4 (Leal-Arenas & Corizzo)Model=DeepSeek V4, Variant=Leal-Arenas & Corizzo2026.06 | 80.3 | 81.3 | 79.2 | 79.6 | |
| DeepSeek V4 (No Taxonomy)Model=DeepSeek V4, Variant=No Taxonomy2026.06 | 79.8 | 80.9 | 78.6 | 79 | |
| GPT-5.4 (Fillies & Paschke)Model=GPT-5.4, Variant=Fillies & Paschke2026.06 | 79.4 | 81.7 | 77.8 | 78.2 | |
| DeepSeek V4 (Calhoun & Fawcett)Model=DeepSeek V4, Variant=Calhoun & Fawcett2026.06 | 79.1 | 80.6 | 77.8 | 78.2 | |
| Sonnet 4.6 (Zhang et al.)Model=Sonnet 4.6, Variant=Zhang et al.2026.06 | 78.8 | 80.8 | 77.3 | 77.6 | |
| GPT-5.4 (No Taxonomy)Model=GPT-5.4, Variant=No Taxonomy2026.06 | 78.5 | 81.1 | 76.8 | 77.1 | |
| DeepSeek V4 (Zhang et al.)Model=DeepSeek V4, Variant=Zhang et al.2026.06 | 77.7 | 79.9 | 76 | 76.4 | |
| GPT-5.4 (Calhoun & Fawcett)Model=GPT-5.4, Variant=Calhoun & Fawcett2026.06 | 76.9 | 79.7 | 75.1 | 75.3 | |
| GPT-5.4 (Zhang et al.)Model=GPT-5.4, Variant=Zhang et al.2026.06 | 76.6 | 79 | 74.9 | 75.2 | |
| Character N-Grams+SVM (Grouped)Model=Supervised NLP, Variant=Character N-Grams+SVM (Grouped)2026.06 | 68.4 | 68.8 | 66.8 | 66.7 | |
| TF–IDF+Logistic Regression (Grouped)Model=Supervised NLP, Variant=TF–IDF+Logistic Regression (Grouped)2026.06 | 68.1 | 67.8 | 67.7 | 67.7 | |
| embedding-graph centralityModel=Unsupervised NLP, Variant=embedding-graph centrality2026.06 | 58.6 | 57.7 | 56.9 | 56.4 | |
| Word2Vec cosine-to-seedModel=Unsupervised NLP, Variant=Word2Vec cosine-to-seed2026.06 | 51.5 | 53.5 | 53.1 | 50.9 |