Dolly
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Dolly-15k Mistral-7B variant (Seen)
86Seen ASR
14
Dolly D2
49.2Mean Match Ratio
11
Dolly Dataset
92FSR
10
Dolly-15K
18.86Speedup
10
Dolly CW
55TPR @ 1% FPR
7
Dolly-15k OOD triggers 1.0 (test)
47.2OOD ASR
7
Dolly-15k Mistral-7B variant (OOD)
27.7OOD ASR
7
Dolly-15k Clean Mistral-7B variant (val)
19.7Clean PPL
7
Dolly Eval
54A Win Rate
7
Dolly CW
67TPR @ FPR=10%
6
Dolly
4.1Correctness
6
Dolly-15k Qwen2.5-7B (test)
84.21Precision
6
Dolly-15k Qwen2.5-3B (test)
80.55Precision
6
Dolly 15% retention (train)
154.11SUM
6
Dolly (5% retention)
153.582SUM
6
Dolly CW
100KGW
5
Dolly Eval
62A Win Rate
5
Dolly-15k
0.445Accuracy
4
Dolly
36Distinct-1
4
Dolly CW
98TPR @ FPR=10%
4
Dolly
100ASR
4
Dolly (10% sub-sampled)
58.76Win Rate (vs. Clust Rand)
4
Dolly
66.66MMLU Score
2
Dolly summarization
99.8Bracket Percentage
1
Dolly-15K
—Primary metric
0