HELM
Benchmarks
Task NameDataset NameSOTA ResultTrendResults
HELM Passage Level v1.0 (test)
0.96AUC
84
HELM Sentence Level v1.0 (test)
0.884AUC
84
HELM macro-averaged (test)
73.2Accuracy
30
HELM Lite
64.3OpenAI Performance
26
SEA-HELM
54.1Indonesian
18
HELM
54Synth. Reason. (AS)
16