Creative Writing on Creative Writing (test)
90.38Creativity+ HE prompt
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| + HE promptJudge LLM=DeepSeek-V3, Backbone=Qwen3-8B, Prompting=HE prompt2026.04 | 90.38 | 88.27 | 84.42 | 83.85 | 87.5 | — | — | |
| OriginalJudge LLM=DeepSeek-V3, Backbone=Qwen3-8B2026.04 | 89.62 | 85.19 | 84.62 | 84.71 | 84.33 | — | — | |
| Policy SplitJudge LLM=DeepSeek-V3, Backbone=Qwen3-8B2026.04 | 89.23 | 85.87 | 84.13 | 83.46 | 75.88 | — | — | |
| GRPOJudge LLM=DeepSeek-V3, Backbone=Qwen3-8B2026.04 | 89.04 | 85.19 | 84.33 | 83.85 | 84.71 | — | — | |
| w/ Ent AdvJudge LLM=DeepSeek-V3, Backbone=Qwen3-8B2026.04 | 88.85 | 85.38 | 84.62 | 84.23 | 84.71 | — | — | |
| + HE promptJudge LLM=GPT-4o, Backbone=Qwen3-8B, Prompting=HE prompt2026.04 | 84.38 | 77.88 | 86.39 | 80.91 | 86.88 | — | — | |
| Policy SplitJudge LLM=GPT-4o, Backbone=Qwen3-8B2026.04 | 81.88 | 74.9 | 86.35 | 80.53 | 83.41 | — | — | |
| OriginalJudge LLM=GPT-4o, Backbone=Qwen3-8B2026.04 | 81.54 | 74.9 | 85.96 | 79.9 | 84.71 | — | — | |
| w/ Ent AdvJudge LLM=GPT-4o, Backbone=Qwen3-8B2026.04 | 80.82 | 73.27 | 85.77 | 79.47 | 83.94 | — | — | |
| GRPOJudge LLM=GPT-4o, Backbone=Qwen3-8B2026.04 | 80.67 | 72.88 | 86.35 | 79.42 | 83.75 | — | — | |
| + HE promptJudge LLM=GPT-5, Backbone=Qwen3-8B, Prompting=HE prompt2026.04 | 62.5 | 55.29 | 70.48 | 56.06 | 65.67 | — | — | |
| Policy Split + HE promptBackbone=Qwen3-8B, Prompting Strategy=HE prompt2026.04 | 62.5 | 55.29 | 70.48 | 56.06 | 65.67 | 52.08 | 65.34 | |
| Policy SplitJudge LLM=GPT-5, Backbone=Qwen3-8B2026.04 | 57.88 | 48.46 | 68.08 | 54.18 | 60.19 | — | — | |
| Policy SplitBackbone=Qwen3-8B2026.04 | 57.88 | 48.46 | 68.08 | 54.18 | 60.19 | 50.04 | 61.67 | |
| OriginalJudge LLM=GPT-5, Backbone=Qwen3-8B2026.04 | 57.69 | 48.56 | 69.81 | 55.19 | 62.21 | — | — | |
| OriginalBackbone=Qwen3-8B2026.04 | 57.69 | 48.56 | 69.81 | 55.19 | 62.21 | 49.62 | 60.34 | |
| w/ Ent AdvJudge LLM=GPT-5, Backbone=Qwen3-8B2026.04 | 57.02 | 47.5 | 69.42 | 53.56 | 60.67 | — | — | |
| w/ Ent AdvantageBackbone=Qwen3-8B, Base Training=GRPO2026.04 | 57.02 | 47.5 | 69.42 | 53.56 | 60.67 | 49.67 | 60.74 | |
| GRPOJudge LLM=GPT-5, Backbone=Qwen3-8B2026.04 | 55.29 | 47.31 | 68.56 | 53.94 | 59.71 | — | — | |
| GRPOBackbone=Qwen3-8B2026.04 | 55.29 | 47.31 | 68.56 | 53.94 | 59.71 | 49.82 | 60.26 |