Machine-generated text detection on SQuAD
99AUROCOurs
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| OursGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 99 | — | — | |
| OursGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 99 | — | — | |
| OursGenerator=LLAMA 3 8B, Evaluation Protocol=Supervised2025.01 | 99 | — | — | |
| OursGenerator=GPT-NEOX Erebus, Evaluation Protocol=Supervised2025.01 | 99 | — | — | |
| OursGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 97 | — | — | |
| Roberta (base)Generator=LLAMA 3 8B, Evaluation Protocol=Supervised2025.01 | 97 | — | — | |
| OursGenerator=QWEN 32B, Evaluation Protocol=Supervised2025.01 | 97 | — | — | |
| Roberta (large)Generator=LLAMA 3 8B, Evaluation Protocol=Supervised2025.01 | 95 | — | — | |
| LogRankGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 93 | — | — | |
| Roberta (large)Generator=GPT-NEOX Erebus, Evaluation Protocol=Supervised2025.01 | 93 | — | — | |
| Roberta (base)Generator=GPT-NEOX Erebus, Evaluation Protocol=Supervised2025.01 | 92 | — | — | |
| log p(x)Generator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 91 | — | — | |
| LogRankGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 81 | — | — | |
| DetectGPTGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 78 | — | — | |
| BinocularsGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 78 | — | — | |
| log p(x)Generator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 75 | — | — | |
| RankGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 71 | — | — | |
| RankGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 71 | — | — | |
| EntropyGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 70 | — | — | |
| Roberta (base)Generator=QWEN 32B, Evaluation Protocol=Supervised2025.01 | 69 | — | — | |
| Roberta (large)Generator=QWEN 32B, Evaluation Protocol=Supervised2025.01 | 68 | — | — | |
| EntropyGenerator=GPT-NEOX Erebus, Evaluation Protocol=Zero-shot2025.01 | 66 | — | — | |
| LogRankGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 62 | — | — | |
| DetectGPTGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 62 | — | — | |
| BinocularsGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 62 | — | — | |
| log p(x)Generator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 60 | — | — | |
| RankGenerator=QWEN 32B, Evaluation Protocol=Zero-shot2025.01 | 55 | — | — | |
| DetectGPTGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 55 | — | — | |
| BinocularsGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 55 | — | — | |
| EntropyGenerator=LLAMA 3 8B, Evaluation Protocol=Zero-shot2025.01 | 37 | — | — | |
| BinocularsMethod Category=Metric-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 79.65 | 79.29 | |
| DEERMethod Category=Domain generalization methods, Evaluation Scenario=IND-MGT2025.11 | — | 93.15 | 93.2 | |
| EAGLEMethod Category=Model-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 92.08 | 92.39 | |
| EntropyMethod Category=Metric-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 67.51 | 63.79 | |
| Fast-DetectGPTMethod Category=Metric-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 75.65 | 76.27 | |
| GhostbusterMethod Category=Model-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 89.99 | 89.89 | |
| ImBDMethod Category=Model-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 74.87 | 79.65 | |
| Log-LikelihoodMethod Category=Metric-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 77.98 | 78.63 | |
| LRRMethod Category=Metric-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 75 | 72.49 | |
| MGT-PrismMethod Category=Domain generalization methods, Evaluation Scenario=IND-MGT2025.11 | — | 91.81 | 92.57 | |
| MoSEsMethod Category=Model-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 86.3 | 86.16 | |
| MSCLMethod Category=Domain generalization methods, Evaluation Scenario=IND-MGT2025.11 | — | 91.6 | 91.86 | |
| PeCoLAMethod Category=Model-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 91.67 | 91.65 | |
| RankMethod Category=Metric-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 68.8 | 64.77 | |
| RobertaMethod Category=Model-based methods, Evaluation Scenario=IND-MGT2025.11 | — | 92.4 | 92.74 | |
| TACITMethod Category=Domain generalization methods, Evaluation Scenario=IND-MGT2025.11 | — | 86.4 | 87.09 |