Machine-generated text detection on XSum
100AUROCOurs
Evaluation Results
| Method | Links | |
|---|---|---|
| OursGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 100 | |
| OursGenerator=QWEN 32B, Evaluation Protocol=Supervised2025.01 | 100 | |
| LAPDscore standardization=true, perturbing or generating auxiliary sequences=true, base model=Llama2-7B, aligned model=Llama2-7B-Instruct2026.04 | 99.84 | |
| DNA-DetectLLMscore standardization=true, perturbing or generating auxiliary sequences=true2026.04 | 99.35 | |
| log p(x)Generator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 99 | |
| LogRankGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 99 | |
| DetectGPTGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 99 | |
| BinocularsGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 99 | |
| OursGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 99 | |
| OursGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 99 | |
| OursGenerator=LLAMA 3 8B, Evaluation Protocol=Supervised2025.01 | 99 | |
| OursGenerator=GPT-NEOX Erebus, Evaluation Protocol=Supervised2025.01 | 99 | |
| RAIscore standardization=false, base model=Llama2-7B, aligned model=Llama2-7B-Instruct2026.04 | 98.94 | |
| Fast-DetectGPTscore standardization=true, perturbing or generating auxiliary sequences=true2026.04 | 98.17 | |
| Binocularsscore standardization=false2026.04 | 98.13 | |
| log p(x)Generator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 98 | |
| LogRankGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 98 | |
| Roberta (base)Generator=LLAMA 3 8B, Evaluation Protocol=Supervised2025.01 | 98 | |
| Roberta (large)Generator=LLAMA 3 8B, Evaluation Protocol=Supervised2025.01 | 98 | |
| Roberta (large)Generator=GPT-NEOX Erebus, Evaluation Protocol=Supervised2025.01 | 98 | |
| Lastde++score standardization=true, perturbing or generating auxiliary sequences=true2026.04 | 96.59 | |
| DetectGPTGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 95 | |
| BinocularsGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 95 | |
| Roberta (base)Generator=GPT-NEOX Erebus, Evaluation Protocol=Supervised2025.01 | 95 | |
| Roberta (base)Generator=QWEN 32B, Evaluation Protocol=Supervised2025.01 | 92 | |
| Roberta (large)Generator=QWEN 32B, Evaluation Protocol=Supervised2025.01 | 92 | |
| LogRankGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 87 | |
| log p(x)Generator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 84 | |
| DetectGPTGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 78 | |
| BinocularsGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 78 | |
| RankGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 75 | |
| Entropyscore standardization=false2026.04 | 72.76 | |
| Likelihoodscore standardization=false2026.04 | 70.02 | |
| EntropyGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 70 | |
| LogRankscore standardization=false2026.04 | 69.58 | |
| RankGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 69 | |
| RankGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 69 | |
| DetectGPTscore standardization=true, perturbing or generating auxiliary sequences=true2026.04 | 64.77 | |
| EntropyGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 40 | |
| EntropyGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 39 |