Validation timing detection on Human-validated English
70.81Overall Macro-F1Human
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Human2026.06 | 70.81 | 66.84 | 84.67 | 74.71 | |
| ModernBERT2026.06 | 69.81 | 67.24 | 78 | 72.22 | |
| XLM-RoBERTa2026.06 | 69 | 73.17 | 60 | 65.93 | |
| MEGUMI2026.06 | 64.58 | 76.67 | 46 | 57.5 | |
| BERT2026.06 | 63.47 | 61.29 | 76 | 67.86 | |
| GPT 4o NanoEvaluation Protocol=Zero-shot2026.06 | 50.02 | 50.69 | 46 | 48.21 | |
| GPT 4o NanoEvaluation Protocol=3-shot2026.06 | 49.11 | 51.97 | 84.4 | 64.33 | |
| GPT 4o NanoEvaluation Protocol=CoT2026.06 | 47.31 | 53.13 | 95.2 | 68.2 | |
| Random Baseline2026.06 | 47 | 47.17 | 50 | 48.54 | |
| Llama 3.1 8bEvaluation Protocol=LoRA2026.06 | 44.16 | 50.59 | 86 | 63.7 | |
| Llama 3.1 8bEvaluation Protocol=3-shot2026.06 | 42.75 | 51.6 | 97.6 | 67.51 | |
| Llama 3.1 8bEvaluation Protocol=Zero-shot2026.06 | 37.57 | 49.68 | 95.2 | 65.28 |