Sexism Detection on EDOS SemEval Task 10 Task B 2023 (test)
74.21Macro F1C2 + Routing to CEJL→C
Evaluation Results
| Method | Links | |
|---|---|---|
| C2 + Routing to CEJL→CVariant=C4, Evaluation Protocol=Persona-based debate, Debate Model=LLAMA-3.3-70B, Judge=COGITO-70B2025.12 | 74.21 | |
| PaLM EnsemblePre-training=false2025.06 | 73.26 | |
| PaLM EnsembleEvaluation Protocol=Ensemble2025.12 | 73.26 | |
| C2 + Routing to CEJQ→CVariant=C3, Evaluation Protocol=Persona-based debate, Debate Model=QWEN2.5-72B-INSTRUCT2025.12 | 73.24 | |
| Mistral-7B Fallback Ensemble + Definition-based Data Augmentation (DDA)Pre-training=Mixed2025.06 | 72.77 | |
| DDAEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 72.77 | |
| Mistral-7B Fallback Ensemble + Contextual Semantic Expansion (CSE)Pre-training=Mixed2025.06 | 72.43 | |
| CSEEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 72.43 | |
| RoBERTa, HateBERTPre-training=true2025.06 | 72.12 | |
| RoBERTa-Large, ELECTRAPre-training=true2025.06 | 72.03 | |
| RoBERTa-Large + ELECTRAEvaluation Protocol=Leaderboard Reference2025.12 | 72.03 | |
| Mistral-7B Fallback Ensemble + Baseline PromptPre-training=Mixed2025.06 | 70.49 | |
| Mistral-7B Fallback EnsemblePre-training=Mixed2025.06 | 70.27 | |
| DeBERTa-v3-largePre-training=true2025.06 | 68.75 | |
| DTFNPre-training=true2025.06 | 68.37 | |
| Mistral-7BPre-training=false2025.06 | 66.39 | |
| SEFMPre-training=false2025.06 | 66.19 | |
| SEFMEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 66.19 | |
| QConPre-training=true2025.06 | 64 | |
| QConEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 64 | |
| C1 + Task-specific regulationsVariant=C2, Evaluation Protocol=Fine-tuned2025.12 | 62.79 | |
| LLAMA-3.2-3BVariant=C1, Evaluation Protocol=Fine-tuned2025.12 | 59.41 | |
| HULATPre-training=false2025.06 | 58.77 | |
| HULATEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 58.77 | |
| GPT-5.2Evaluation Protocol=Zero-shot2025.12 | 45.43 | |
| COGITO-70B (reasoning)Evaluation Protocol=Zero-shot, Reasoning Mode=true2025.12 | 43.25 | |
| LLAMA-3.3-70B-INSTRUCTEvaluation Protocol=Zero-shot2025.12 | 42.97 | |
| QWEN-2.5-72B-INSTRUCTEvaluation Protocol=Zero-shot2025.12 | 42.46 | |
| COGITO-70BEvaluation Protocol=Zero-shot2025.12 | 42.14 |