Social Risks (2-class) Evaluation on ValEval Disturb
0.8688AccuracyFairEval
Evaluation Results
| Method | Links | |
|---|---|---|
| FairEvalEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.8688 | |
| CrowdworkerEvaluation Protocol=Tuning-based Evaluation2024.07 | 0.86 | |
| CalibrateEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.8443 | |
| WideDeepEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.8438 | |
| CLAVE-MistralEvaluation Protocol=Tuning-based Evaluation, Backbone=Mistral-7b2024.07 | 0.8399 | |
| Chain-of-thoughtEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.8386 | |
| ChatEvalEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.8375 | |
| G-EvalEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.834 | |
| AllureEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.831 | |
| Few-shotEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.8207 | |
| VanillaEvaluation Protocol=Prompt-based Evaluation2024.07 | 0.812 | |
| CLAVE-LlamaEvaluation Protocol=Tuning-based Evaluation, Backbone=Llama2-7b2024.07 | 0.7879 | |
| Mistral-7bEvaluation Protocol=Tuning-based Evaluation, Backbone=Mistral-7b2024.07 | 0.765 | |
| Phi-3Evaluation Protocol=Tuning-based Evaluation, Backbone=Phi-32024.07 | 0.7359 | |
| Llama2-7bEvaluation Protocol=Tuning-based Evaluation, Backbone=Llama2-7b2024.07 | 0.6861 | |
| GPT-2-LargeEvaluation Protocol=Tuning-based Evaluation, Backbone=GPT-2-Large2024.07 | 0.6528 |