Zero-shot General Language Understanding on GPT-3 Evaluation Suite (11 Tasks)
33.6Average AccuracyGPT-3 125M (Original)
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-3 125M (Original)Batch size=256, Training tokens=300B, Evaluation Mode=Zero-shot2021.08 | 33.6 | |
| GPT-3 125M (Baseline Reproduced)Batch size=256, Training tokens=300B, Evaluation Mode=Zero-shot2021.08 | 31.4 | |
| Sequence Length Warmup (SLW 40x LR)Batch size=2K, Training tokens=30B, Learning rate=40x, Evaluation Mode=Zero-shot2021.08 | 31.1 | |
| GPT-3 125M (Baseline 30x LR)Batch size=2K, Training tokens=30B, Learning rate=30x, Evaluation Mode=Zero-shot2021.08 | 29.8 |