Validation timing detection on M-TESC Japanese
57.09Overall Macro-F1MEGUMI
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MEGUMI2026.06 | 57.09 | 41.35 | 55.84 | 47.51 | |
| BERT2026.06 | 55.67 | 40.9 | 58.56 | 48.16 | |
| XLM-RoBERTa2026.06 | 54.39 | 39.45 | 49.05 | 43.73 | |
| GPT 4o NanoEvaluation Protocol=Zero-shot2026.06 | 52.48 | 39.63 | 74.68 | 51.78 | |
| ModernBERT2026.06 | 51.51 | 38.18 | 66.92 | 48.62 | |
| Random Baseline2026.06 | 49.22 | 34.54 | 49.77 | 40.77 | |
| GPT 4o NanoEvaluation Protocol=3-shot2026.06 | 43.38 | 37.53 | 91.41 | 53.21 | |
| GPT 4o NanoEvaluation Protocol=CoT2026.06 | 41.28 | 35.88 | 91.69 | 51.57 | |
| Llama 3.1 8bEvaluation Protocol=LoRA2026.06 | 38.71 | 34.02 | 85.71 | 48.71 | |
| Llama 3.1 8bEvaluation Protocol=Zero-shot2026.06 | 29.75 | 34.74 | 98.21 | 51.33 | |
| Llama 3.1 8bEvaluation Protocol=3-shot2026.06 | 27.07 | 34.46 | 99.85 | 51.23 |