Vicuna
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
Vicuna
20.93Rouge-L
101
Vicuna-7b 16k 50 samples v1.5
0.986AUROC (Overall)
94
Vicuna 7B
98.46Attack Success Rate (ASR)
58
Vicuna 13B
98.65Attack Success Rate (ASR)
55
Vicuna Eval (test)
20.37ROUGE-L
36
Vicuna 7b 16k v1.5 (test)
62ASR
30
Vicuna
73.6SBERT Similarity
24
Vicuna benchmark zero-shot
119.4Pairwise Score (ChatGPT vs Sys)
21
Vicuna Benchmark
65.1Pearson Correlation (r)
20
Vicuna
18.73RougeL Score
19
Vicuna Eval
66.3Win Rate (A)
19
Vicuna
99.1Skywork Reward V2 Score
18
SC-Vicuna
71.4AUROC
18
Vicuna benchmark
8.09GPT-4 Evaluation Score
18
Vicuna
58.2Score
18
Vicuna Out-of-Distribution
51.9GPT-4o Score
17
Vicuna
15.05Rouge-L
16
Vicuna Evaluation Benchmark
76.3Accuracy
16
Vicuna 80 prompts (test)
1,348Elo
16
vicuna-7b 50 samples, UMD watermarking v1.5-16k (test)
58ASR (0 Unattacked)
15
Vicuna (test)
19.4ROUGE-L
14
Vicuna
97.3Exact Match
13
Vicuna-bench
8.24Score
13
Vicuna Eval
16.31ROUGE-L
11
Vicuna-80 v1 (test)
85.6Score
10