ResearchDatasetsJust-EvalFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsUtility EvaluationJust-Eval4.83Just-Eval Average Score50Model Helpfulness EvaluationJust-Eval (test)4.96Helpfulness Score42Benign prompt classificationJust-Eval benign99Accuracy15Instruction-followingJust-Eval4.25Helpfulness10General Usability EvaluationJust Eval4.78Helpfulness6