MAGE
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
MAGE yelp held-out
0.95AUROC
3
MAGE xsum held-out
0.897AUROC
3
MAGE (wp held-out)
98.2AUROC
3
MAGE tldr (held-out)
0.962AUROC
3
MAGE squad held-out
97.9AUROC
3
MAGE sci_gen held-out
96.9AUROC
3
MAGE roct (held-out)
0.907AUROC
3
MAGE hswag held-out
93.2AUROC
3
MAGE eli5 (held-out)
0.958AUROC
3
MAGE cmv (held-out)
0.992AUROC
3
MAGE DeepSeek-R1 OOD
71Accuracy
3
MAGE Claude-sonnet-4-5 OOD
57.1Accuracy
3
MAGE GPT-5 OOD
68.7Accuracy
3
MAGE GPT-4 OOD
61.8Accuracy
3
MAGE Paraphrasing attack
68.6Average Recall
2
MAGE (In-distribution)
90.5Average Recall
2
MAGE CNN/DailyMail, DialogSum, PubMedQA, IMDb with GPT-4 (held-out split)
76AvgRec
2
MAGE Unseen Domains (test)
95AUROC
2