Language Modeling on WritingPrompts (test)
88Diversity (div)GPT-2 (MLE)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| GPT-2 (MLE)Model Size=Medium, Objective=MLE, Sampling=Unbiased2023.05 | 88 | 22.72 | 89 | 41.4 | |
| GPT-2 (MLE)Model Size=Small, Objective=MLE, Sampling=Unbiased2023.05 | 87 | 28.45 | 85 | 39.7 | |
| GPT-2 (MLE)Model Size=Large, Objective=MLE, Sampling=Unbiased2023.05 | 87 | 21.95 | 87 | 42.5 | |
| GPT-2 (MIXCE)Model Size=Small, Objective=MIXCE, Sampling=Unbiased2023.05 | 86 | 28.79 | 89 | 40.3 | |
| GPT-2 (MIXCE)Model Size=Medium, Objective=MIXCE, Sampling=Unbiased2023.05 | 86 | 23.04 | 91 | 41.9 | |
| GPT-2 (MIXCE)Model Size=Large, Objective=MIXCE, Sampling=Unbiased2023.05 | 86 | 21.04 | 94 | 42.9 | |
| MLEModel Size=Small, best p=0.97, decoding=top-p sampling2023.05 | 86 | — | 90 | 41 | |
| MLEModel Size=Medium, best p=0.97, decoding=top-p sampling2023.05 | 86 | — | 92 | 42.8 | |
| MLEModel Size=Large, best p=0.99, decoding=top-p sampling2023.05 | 86 | — | 89 | 43 | |
| MIXCEModel Size=Large, best p=0.99, decoding=top-p sampling2023.05 | 86 | — | 94 | 43.5 | |
| HumanSampling=Unbiased2023.05 | 85 | — | 100 | 47.3 | |
| Humandecoding=unbiased sampling2023.05 | 85 | — | 100 | 47.3 | |
| MIXCEModel Size=Small, best p=0.99, decoding=top-p sampling2023.05 | 85 | — | 90 | 40.7 | |
| MIXCEModel Size=Medium, best p=0.99, decoding=top-p sampling2023.05 | 85 | — | 92 | 42.7 |