Multi-dimensional creativity assessment on Fine-grained Creativity Assessment (val)
1,943.67FluencyThemis
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| ThemisModel Type=Fine-tuned model, Scoring Protocol=Fine-tuned2026.06 | 1,943.67 | 1,143.48 | 1,148.6 | 1,830.02 | 1,576.83 | 963.4 | 2,366.62 | 1,483.35 | 1,557 | |
| Gemini-2.5-proModel Type=Foundation Model, Scoring Protocol=Prompt-based2026.06 | 358.75 | 465.68 | 444.08 | 419.44 | 506.66 | 555.39 | 597.76 | 550.12 | 487.24 | |
| M-Prometheus-7BModel Type=Fine-tuned model, Scoring Protocol=Fine-tuned2026.06 | 352.5 | 402.72 | 465.48 | 405.02 | 488.47 | 416.18 | 407.1 | 510.42 | 430.99 | |
| GPT-4oModel Type=Foundation Model, Scoring Protocol=Prompt-based2026.06 | 305.51 | 347.46 | 400.42 | 372.1 | 355.73 | 369.64 | 395.76 | 332.93 | 359.94 | |
| Deepseek-R1Model Type=Foundation Model, Scoring Protocol=Prompt-based2026.06 | 298.73 | 207.1 | 226.75 | 240.95 | 225.88 | 166.9 | 332.37 | 271.61 | 246.29 | |
| Qwen3-max-previewModel Type=Foundation Model, Scoring Protocol=Prompt-based2026.06 | 243.64 | 208.93 | 251.24 | 300.58 | 231.15 | 230.19 | 440.25 | 276.44 | 272.8 | |
| DEFINEDBackbone=Qwen2.5-7B-Instruct, Training Technique=LoRA, Scoring Protocol=Fine-tuned2026.06 | 42.24 | 34.04 | 59.6 | 46.72 | 35.98 | 35.76 | 57.01 | 33.36 | 43.09 |