LLM-generated text detection on Xsum, WritingPrompts, and SQuAD generated by GPT-4.1-mini (test)
80.25AUROCSurpMark
Evaluation Results
| Method | Links | |
|---|---|---|
| SurpMarkBlack-box setting=true, k (number of discretization states)=6, B (reference-per-test budget)=22025.10 | 80.25 | |
| SurpMarkBlack-box setting=true, k (number of discretization states)=7, B (reference-per-test budget)=22025.10 | 78.48 | |
| R-DetectBlack-box setting=true2025.10 | 71.64 | |
| BinocularsBlack-box setting=true2025.10 | 71.12 | |
| DetectNPRBlack-box setting=true, B (reference-per-test budget)=1002025.10 | 70.83 | |
| DetectGPTBlack-box setting=true, B (reference-per-test budget)=1002025.10 | 70.08 | |
| Fast-DetectGPTBlack-box setting=true2025.10 | 68.32 | |
| Lastde++Black-box setting=true, B (reference-per-test budget)=1002025.10 | 68.23 | |
| LogRankBlack-box setting=true2025.10 | 66.8 | |
| LikelihoodBlack-box setting=true2025.10 | 66.77 | |
| DetectLRRBlack-box setting=true2025.10 | 63.29 | |
| FourierGPTBlack-box setting=true2025.10 | 63.05 | |
| LastdeBlack-box setting=true2025.10 | 57.28 | |
| DNA-GPTBlack-box setting=true, B (reference-per-test budget)=102025.10 | 56.71 | |
| EntropyBlack-box setting=true2025.10 | 38.72 |