LLM-generated text detection on Xsum, WritingPrompts, and SQuAD (GPT-5-Chat test)
81.33AUROCSurpMark
Evaluation Results
| Method | Links | |
|---|---|---|
| SurpMarkBlack-box setting=true, k (number of discretization states)=7, B (reference-per-test budget)=22025.10 | 81.33 | |
| SurpMarkBlack-box setting=true, k (number of discretization states)=6, B (reference-per-test budget)=22025.10 | 78.33 | |
| R-DetectBlack-box setting=true2025.10 | 67.75 | |
| FourierGPTBlack-box setting=true2025.10 | 64.82 | |
| DetectNPRBlack-box setting=true, B (reference-per-test budget)=1002025.10 | 54.99 | |
| DetectGPTBlack-box setting=true, B (reference-per-test budget)=1002025.10 | 54.6 | |
| LogRankBlack-box setting=true2025.10 | 49.83 | |
| DetectLRRBlack-box setting=true2025.10 | 49.83 | |
| DNA-GPTBlack-box setting=true, B (reference-per-test budget)=102025.10 | 49.82 | |
| BinocularsBlack-box setting=true2025.10 | 49.65 | |
| LikelihoodBlack-box setting=true2025.10 | 49.62 | |
| EntropyBlack-box setting=true2025.10 | 46.99 | |
| Lastde++Black-box setting=true, B (reference-per-test budget)=1002025.10 | 43.51 | |
| Fast-DetectGPTBlack-box setting=true2025.10 | 43.39 | |
| LastdeBlack-box setting=true2025.10 | 41.96 |