Humor Generation on HumorRank
1,307.5BT RatingGPT-5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-5Judge Model=Llama 3.3 70B2026.03 | 1,307.5 | 1,288.5 | 84 | |
| Kimi-K2Judge Model=Llama 3.3 70B2026.03 | 1,156.9 | 1,139.9 | 67.8 | |
| Gemini 2.5 ProJudge Model=Llama 3.3 70B2026.03 | 1,115.1 | 1,096.6 | 62.6 | |
| HumorGen-7BJudge Model=Llama 3.3 70B2026.03 | 1,092.8 | 1,077.6 | 59.8 | |
| Claude 3.5 HaikuJudge Model=Llama 3.3 70B2026.03 | 1,037.5 | 1,022.4 | 52.7 | |
| GPT OSS 120BJudge Model=Llama 3.3 70B2026.03 | 1,015 | 1,004.2 | 49.8 | |
| Qwen 3 32BJudge Model=Llama 3.3 70B2026.03 | 976.9 | 965 | 45 | |
| Llama 3.3 70BJudge Model=Llama 3.3 70B2026.03 | 761 | 745.1 | 21.8 | |
| Base Qwen 7BJudge Model=Llama 3.3 70B2026.03 | 537.4 | 513.5 | 6.5 |