LLM-Generated Text Detection on GB Essay GPT4o (test)
99.365AUROCPerplexity
Evaluation Results
| Method | Links | |
|---|---|---|
| PerplexityAggregation=Average AUROC across 12 reference models2026.07 | 99.365 | |
| DetectLLMAggregation=Average AUROC across 12 reference models2026.07 | 99.163 | |
| TelescopeAggregation=Average AUROC across 12 reference models2026.07 | 98.136 | |
| BinocularsAggregation=Average AUROC across 12 reference models2026.07 | 85.505 | |
| Fast-DetectGPTAggregation=Average AUROC across 12 reference models2026.07 | 51.477 |