LLM-Generated Text Detection on GB Essay ChatGPT (test)
99.81AUROCPerplexity
Evaluation Results
| Method | Links | |
|---|---|---|
| PerplexityAggregation=Average AUROC across 12 reference models2026.07 | 99.81 | |
| DetectLLMAggregation=Average AUROC across 12 reference models2026.07 | 99.73 | |
| TelescopeAggregation=Average AUROC across 12 reference models2026.07 | 98.628 | |
| BinocularsAggregation=Average AUROC across 12 reference models2026.07 | 88.434 | |
| Fast-DetectGPTAggregation=Average AUROC across 12 reference models2026.07 | 55.624 |