Story Evaluation on StoryER (test)
0.6774Pearson CorrelationEvolvR
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| EvolvRModel Category=Story Evalution Finetune Open-source Models2025.08 | 0.6774 | 0.6 | 0.5353 | 0.0528 | 94.74 | |
| GPT-o3-0416-globalModel Category=General Closed-source Models2025.08 | 0.5682 | 0.4944 | 0.4402 | 0.0477 | 87.03 | |
| Qwen2.5-7B-Instruct + Point CoTModel Category=Story Evalution Finetune Open-source Models, Point CoT=true2025.08 | 0.5677 | 0.4784 | 0.4392 | 0.0293 | 93.44 | |
| Qwen2.5-7B-Instruct + Point CoT + GRPOModel Category=Story Evalution Finetune Open-source Models, Point CoT=true, GRPO=true2025.08 | 0.5646 | 0.4831 | 0.4472 | 0.0419 | 94.33 | |
| Gemini-2.5-Pro-06-17Model Category=General Closed-source Models2025.08 | 0.5451 | 0.5275 | 0.4796 | 0.0931 | 88.66 | |
| Themis-8BModel Category=NLG Evalution Open-Source Models2025.08 | 0.5362 | 0.387 | 0.3484 | 0.0743 | 94.59 | |
| GPT-4oModel Category=General Closed-source Models2025.08 | 0.4808 | 0.4679 | 0.3975 | 0.0398 | 89.79 | |
| Claude-4-opus4Model Category=General Closed-source Models2025.08 | 0.4796 | 0.406 | 0.3561 | 0.0995 | 84.4 | |
| Claude-4-SonnetModel Category=General Closed-source Models2025.08 | 0.4157 | 0.3415 | 0.3024 | 0.0676 | 86.62 | |
| Gemini-2.5-flash-06-17Model Category=General Closed-source Models2025.08 | 0.3882 | 0.3042 | 0.2701 | 0.1091 | 91.73 | |
| GPT-4.1Model Category=General Closed-source Models2025.08 | 0.3673 | 0.2908 | 0.2567 | 0.0705 | 89.98 | |
| Qwen2.5-7B-Instruct + GRPOModel Category=Story Evalution Finetune Open-source Models, GRPO=true2025.08 | 0.343 | 0.2436 | 0.2178 | 0.0849 | 87.93 | |
| AutoJ-13BModel Category=NLG Evalution Open-Source Models2025.08 | 0.3182 | 0.1873 | 0.1631 | 0.0623 | 90.12 | |
| CokeModel Category=Story Evalution Finetune Open-source Models2025.08 | 0.3142 | — | — | 0.0812 | 65.09 | |
| TIGERScore-13BModel Category=NLG Evalution Open-Source Models2025.08 | 0.2759 | 0.2364 | 0.2317 | 0.1455 | 86.37 | |
| Qwen2.5-7B-InstructModel Category=Story Evalution Finetune Open-source Models2025.08 | 0.2206 | 0.1611 | 0.1381 | 0.1434 | 83.08 | |
| InstructScore-7BModel Category=NLG Evalution Open-Source Models2025.08 | 0.1902 | 0.1664 | 0.1251 | 0.1303 | 84.3 |