XSum, SQuAD, WritingPrompts
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
XSum, SQuAD, WritingPrompts Average across 12 source models
99.07AUROC
11
XSum, SQuAD, WritingPrompts Phi2-2.7 generated
98.75AUROC
11
XSum, SQuAD, WritingPrompts Gemma-7 generated
98.91AUROC
11
XSum, SQuAD, WritingPrompts Falcon-7 generated
99.71AUROC
11
XSum, SQuAD, WritingPrompts Bloom-7.1 generated
99.94AUROC
11
XSum, SQuAD, WritingPrompts OPT-13 generated
99.33AUROC
11
XSum SQuAD WritingPrompts Llama3-8 generated
99.9AUROC
11
XSum, SQuAD, WritingPrompts Llama2-13 generated
98.01AUROC
11
XSum, SQuAD, WritingPrompts Llama-13 generated
97.41AUROC
11
XSum, SQuAD, WritingPrompts GPT-J generated
99.74AUROC
11
XSum, SQuAD, WritingPrompts OPT-2.7 generated
99.67AUROC
11
XSum, SQuAD, WritingPrompts Neo-2.7 generated
99.88AUROC
11
XSum, SQuAD, WritingPrompts GPT-2 generated
99.72AUROC
11