Humor generation on SemEval Task 1 2026 (test)
1,323.7BT RatingGPT-5
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-52026.03 | 1,323.7 | 1,288 | 84.7 | |
| Kimi-K22026.03 | 1,221.6 | 1,188 | 75.3 | |
| Gemini-2.5-Pro2026.03 | 1,190.3 | 1,157 | 72 | |
| HumorGen SFT-7BFine-tuning=SFT, Model Size=7B2026.03 | 1,083.9 | 1,057 | 59.5 | |
| HumorGen DPO-7BAlignment=DPO, Model Size=7B2026.03 | 1,079.9 | 1,055 | 59 | |
| HumorGen GRPO-7BAlignment=O-GRPO, Model Size=7B2026.03 | 1,034.5 | 1,001 | 53.3 | |
| HumorGen SFT-Think-7BFine-tuning=SFT, Reasoning=Think (CSD), Model Size=7B2026.03 | 993.2 | 965 | 48.2 | |
| GPT-OSS-120BModel Size=120B2026.03 | 989.2 | 957 | 47.7 | |
| HumorGen DPO-Think-7BAlignment=DPO, Reasoning=Think (CSD), Model Size=7B2026.03 | 975.8 | 950 | 46 | |
| Qwen3-32BModel Size=32B2026.03 | 964.3 | 936 | 44.5 | |
| HumorGen GRPO-Think-7BAlignment=O-GRPO, Reasoning=Think (CSD), Model Size=7B2026.03 | 883.5 | 848 | 35 | |
| HumorGen-Com-7BMode=Comedian Adaptation, Model Size=7B2026.03 | 653.1 | 610 | 13.8 | |
| Base Qwen-7BModel Size=7B2026.03 | 607.1 | 560 | 10.8 |