PII Detection on CAPID (test)
96.5Span PrecisionLlama-3.1-8B (FT)
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Llama-3.1-8B (FT)Evaluation Protocol=Fine-tuned2026.02 | 96.5 | 95.98 | 96.03 | 96.06 | 96.74 | 93.06 | 94.13 | 87.04 | |
| Llama-3.2-3B (FT)Evaluation Protocol=Fine-tuned2026.02 | 96.5 | 96.08 | 96.08 | 96.06 | 96.74 | 93.06 | 94.13 | 87.04 | |
| GPT-4.1-miniEvaluation Protocol=Zero-shot, Model Type=Proprietary baseline2026.02 | 87.24 | 94.38 | 89.86 | 89.57 | 90.08 | 83.96 | 87.72 | 72.54 | |
| Microsoft PresidioEvaluation Protocol=Baseline2026.02 | 70.2 | 43.93 | 50.7 | 79.92 | 31.38 | — | — | — | |
| Llama-3.2-3B (Ngong et al., 2025)Evaluation Protocol=Baseline, Reference Approach=Ngong et al., 20252026.02 | 59.97 | 43.23 | 47.08 | 64.27 | — | 59.25 | 80.33 | 0.5 | |
| Llama-3.1-8B (Ngong et al., 2025)Evaluation Protocol=Baseline, Reference Approach=Ngong et al., 20252026.02 | 57.04 | 78.96 | 64.39 | 69.73 | — | 70.02 | 86.35 | 34.08 | |
| Llama-3.1-8BEvaluation Protocol=Pre-trained2026.02 | 40.8 | 70.18 | 48.13 | 52.94 | 52.85 | 51.29 | 59.91 | 30.5 |