Sexism Detection on EDOS SemEval Task 10 Task C 2023 (test)
60.18Macro F1Mistral-7B Fallback Ensemble + Definition-based Data Augmentation (DDA)
Evaluation Results
| Method | Links | |
|---|---|---|
| Mistral-7B Fallback Ensemble + Definition-based Data Augmentation (DDA)Pre-training=Mixed2025.06 | 60.18 | |
| DDAEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 60.18 | |
| C2 + Routing to CEJL→CVariant=C4, Evaluation Protocol=Persona-based debate, Debate Model=LLAMA-3.3-70B, Judge=COGITO-70B2025.12 | 59.04 | |
| C2 + Routing to CEJQ→CVariant=C3, Evaluation Protocol=Persona-based debate, Debate Model=QWEN2.5-72B-INSTRUCT2025.12 | 58.42 | |
| Mistral-7B Fallback Ensemble + Contextual Semantic Expansion (CSE)Pre-training=Mixed2025.06 | 56.39 | |
| CSEEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 56.39 | |
| DeBERTa, RoBERTaPre-training=true2025.06 | 56.06 | |
| Mistral-7B Fallback Ensemble + Baseline PromptPre-training=Mixed2025.06 | 56.01 | |
| RoBERTa-Large, ELECTRAPre-training=true2025.06 | 54.87 | |
| RoBERTa-Large + ELECTRAEvaluation Protocol=Leaderboard Reference2025.12 | 54.87 | |
| RoBERTa, HateBERTPre-training=true2025.06 | 54.12 | |
| DTFNPre-training=true2025.06 | 52.48 | |
| Mistral-7B Fallback EnsemblePre-training=Mixed2025.06 | 52.13 | |
| DeBERTa-v3-largePre-training=true2025.06 | 50.88 | |
| Mistral-7BPre-training=false2025.06 | 48.32 | |
| QConPre-training=true2025.06 | 47 | |
| QConEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 47 | |
| SEFMPre-training=false2025.06 | 46.41 | |
| SEFMEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 46.41 | |
| HULATPre-training=false2025.06 | 44.58 | |
| HULATEvaluation Protocol=Data Augmentation/Ensemble2025.12 | 44.58 | |
| C1 + Task-specific regulationsVariant=C2, Evaluation Protocol=Fine-tuned2025.12 | 41.89 | |
| LLAMA-3.2-3BVariant=C1, Evaluation Protocol=Fine-tuned2025.12 | 37.17 | |
| GPT-5.2Evaluation Protocol=Zero-shot2025.12 | 33.81 | |
| COGITO-70B (reasoning)Evaluation Protocol=Zero-shot, Reasoning Mode=true2025.12 | 28.26 | |
| LLAMA-3.3-70B-INSTRUCTEvaluation Protocol=Zero-shot2025.12 | 27.75 | |
| COGITO-70BEvaluation Protocol=Zero-shot2025.12 | 26.83 | |
| QWEN-2.5-72B-INSTRUCTEvaluation Protocol=Zero-shot2025.12 | 25.76 |