WildChat
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
WildChat
97.5Safe@1
34
WildChat
51Next Token Accuracy
32
WildChat Content
0.4Disagreement Rate (per 1k Conversations)
30
WildChat Intent
0.4Disagreement Rate (per 1k conv)
30
WildChat 5,000 conversations
0.392KLfwd
24
WildChat 5,000 conversations
0.26KL Divergence (Forward)
24
WildChat
42.92Refusal Rate
20
Wildchat
0.33Attack Success Rate (ASR)
18
WildChat
64.2Statistical Power AUC
18
WildChat
0.895AUC (Statistical Power)
18
WildChat Fr
1FSR
18
WildChat (test)
52.16LLM-Judge
17
WildChat (test)
69.85WildChat Score
13
WildChat
75.17RPS (Requests/s)
11
NB-WildChat
42.6Uniqueness Score
11
WildChat
0.31Mean Embedding Similarity
10
WildChat unsafe prompts
99.82Not-Unsafe Rate
9
WildChat (In-Distribution)
8.62Turn Count
8
WildChat 1,034 users 1M (5-fold cross-validation)
64.2Top-1 Accuracy
6
WildChat
0Frustration Rate (T20)
6
WildChat
81.2DSR
6
WildChat (train)
1.195Loss
6
WildChat
28.78BERT-Small Next Token Accuracy (eps=inf)
5
WildChat 12 (test)
49.93Average Latency (ms/query)
4
WildChat
47.3Lexical Coverage
4