ResearchDatasetsGPT-4FollowBenchmarksTask NameDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyTask NameDataset NameSOTA ResultTrendResultsRationale GenerationGPT-4 full-duplex audio7.07Mean Rating1Claim-level Uncertainty QuantificationGPT-4 Arabic (Manual Annotation)—Primary metric0