Sexism Detection on EDOS SemEval Task 10 Task A 2023 (test)
92.14Macro F1C2 + Routing to CEJL→C
Evaluation Results
| Method | Links | |
|---|---|---|
| C2 + Routing to CEJL→CVariant=C4, Evaluation Protocol=Persona-based debate, Debate Model=LLAMA-3.3-70B, Judge=COGITO-70B2025.12 | 92.14 | |
| C2 + Routing to CEJQ→CVariant=C3, Evaluation Protocol=Persona-based debate, Debate Model=QWEN2.5-72B-INSTRUCT2025.12 | 91.95 | |
| C1 + Task-specific regulationsVariant=C2, Evaluation Protocol=Fine-tuned2025.12 | 89.86 | |
| Mistral-7B Fallback Ensemble + Contextual Semantic Expansion (CSE)Pre-training=Mixed2025.06 | 88.19 | |
| CSEEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 88.19 | |
| Mistral-7B Fallback Ensemble + Baseline PromptPre-training=Mixed2025.06 | 87.83 | |
| Mistral-7B Fallback Ensemble + Definition-based Data Augmentation (DDA)Pre-training=Mixed2025.06 | 87.69 | |
| DDAEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 87.69 | |
| DeBERTa-v3-large, twHIN-BERT-largePre-training=true2025.06 | 87.46 | |
| DeBERTa-v3-large + twHIN-BERT-largeEvaluation Protocol=Leaderboard Reference2025.12 | 87.46 | |
| RoBERTa-Large, ELECTRAPre-training=true2025.06 | 87.4 | |
| DeBERTa EnsemblePre-training=false2025.06 | 87.4 | |
| RoBERTa-Large + ELECTRAEvaluation Protocol=Leaderboard Reference2025.12 | 87.4 | |
| DeBERTa EnsembleEvaluation Protocol=Leaderboard Reference2025.12 | 87.4 | |
| Mistral-7B Fallback EnsemblePre-training=Mixed2025.06 | 86.03 | |
| DTFNPre-training=true2025.06 | 85.87 | |
| SEFMPre-training=false2025.06 | 85.38 | |
| SEFMEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 85.38 | |
| DeBERTa-v3-largePre-training=true2025.06 | 84.79 | |
| Mistral-7BPre-training=false2025.06 | 84.55 | |
| QConPre-training=true2025.06 | 84 | |
| QConEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 84 | |
| HULATPre-training=false2025.06 | 82.98 | |
| HULATEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 82.98 | |
| LLAMA-3.2-3BVariant=C1, Evaluation Protocol=Fine-tuned2025.12 | 78.24 | |
| GPT-5.2Evaluation Protocol=Zero-shot2025.12 | 73.06 | |
| LLAMA-3.3-70B-INSTRUCTEvaluation Protocol=Zero-shot2025.12 | 64.21 | |
| COGITO-70B (reasoning)Evaluation Protocol=Zero-shot, Reasoning Mode=true2025.12 | 63.32 | |
| QWEN-2.5-72B-INSTRUCTEvaluation Protocol=Zero-shot2025.12 | 61.9 | |
| COGITO-70BEvaluation Protocol=Zero-shot2025.12 | 61.06 |