ResearchTasksStory Generation QualityFollowBenchmarksDataset NameSOTA MethodSortMost resultsRecently updatedMost papersApplyDataset NameSOTA methodMetricTrendResultsLast Updated180 prompts Aggregate (held-out)GPT-5.472.4Story Quality Score15Jun 4, 2026180 held-out prompts Far OOD 8–12kPOLARIS44.1Story Quality Score1Jun 4, 2026180 prompts Near OOD 4–8k (held-out)POLARIS48.2Story Quality Score1Jun 4, 2026180 held-out prompts (ID 1–4k)POLARIS57.4Story Quality Score1Jun 4, 2026