ResearchDatasetsGPT4-LLMFollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsOver-refusal evaluationPoisoned GPT4-LLM subset35.7Informative Refusal Rate27