Downstream NLP Evaluation on LM Evaluation Harness (test)
70.4Lambada OpenAIPythia-12B
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Pythia-12BShots=0-shot, Number of training tokens=300B2025.05 | 70.4 | 70.6 | 58.9 | 31.7 | 61 | 75.2 | 50.4 | 89.3 | 36.9 | 60.5 | — | |
| PonderPythia-2.8BShots=0-shot, Number of training tokens=300B2025.05 | 68.9 | 66.5 | 60.8 | 32.5 | 63.6 | 75 | 48.6 | 91 | 36.5 | 60.4 | 3.1 | |
| Pythia-6.9BShots=0-shot, Number of training tokens=300B2025.05 | 67.2 | 67.3 | 55.9 | 31.4 | 61 | 75.2 | 48.1 | 89.3 | 36.9 | 59.1 | — | |
| Pythia-12BShots=5-shot, Number of training tokens=300B2025.05 | 66.5 | 71 | 57.1 | 36 | 64.8 | 76.5 | 50.7 | 94.9 | 37.4 | 61.7 | — | |
| PonderPythia-1.4BShots=0-shot, Number of training tokens=300B2025.05 | 65.2 | 62 | 53.8 | 27 | 60.1 | 72.6 | 44 | 89 | 35.2 | 56.5 | 2.4 | |
| Pythia-2.8BShots=0-shot, Number of training tokens=300B2025.05 | 64.6 | 64.4 | 54.3 | 29.5 | 60.2 | 73.8 | 45.4 | 88.5 | 34.9 | 57.3 | — | |
| PonderPythia-2.8BShots=5-shot, Number of training tokens=300B2025.05 | 64.2 | 70.6 | 58.7 | 35.8 | 65.3 | 76.7 | 49 | 94.3 | 39 | 61.5 | 3.9 | |
| OPT-2.7BShots=0-shot, Number of training tokens=300B2025.05 | 63.5 | 60.8 | 56 | 26.8 | 61.2 | 73.8 | 45.9 | 85.8 | 36.2 | 56.7 | — | |
| Pythia-6.9BShots=5-shot, Number of training tokens=300B2025.05 | 62.5 | 69.6 | 54.8 | 35.6 | 62.9 | 76.6 | 48 | 94.6 | 36.7 | 60.1 | — | |
| PonderPythia-1BShots=0-shot, Number of training tokens=300B2025.05 | 62.3 | 60.5 | 51.9 | 27 | 56.5 | 72.2 | 41.8 | 87.4 | 35.4 | 55 | 4.4 | |
| Pythia-1.4BShots=0-shot, Number of training tokens=300B2025.05 | 61.6 | 60.4 | 49.7 | 25.9 | 57.5 | 70.8 | 40.4 | 86.4 | 34.1 | 54.1 | — | |
| OPT-2.7BShots=5-shot, Number of training tokens=300B2025.05 | 60.2 | 64.7 | 55 | 29.8 | 62.2 | 75.1 | 46.1 | 93 | 37.5 | 58.2 | — | |
| PonderPythia-1.4BShots=5-shot, Number of training tokens=300B2025.05 | 59.2 | 67.5 | 49.9 | 32.4 | 60.4 | 73.5 | 44.2 | 94.3 | 37.1 | 57.6 | 3.5 | |
| Pythia-2.8BShots=5-shot, Number of training tokens=300B2025.05 | 59 | 67 | 50.7 | 31 | 61.1 | 74.4 | 45.3 | 93.7 | 35.9 | 57.6 | — | |
| Tinyllama-1.1BShots=0-shot, Number of training tokens=3T2025.05 | 58.8 | 60.3 | 49.3 | 28 | 59 | 73.3 | 45 | 88.9 | 36.4 | 55.4 | — | |
| OPT-1.3BShots=0-shot, Number of training tokens=300B2025.05 | 57.9 | 57.1 | 52.5 | 23.4 | 59.7 | 71.8 | 41.6 | 84.3 | 34.3 | 53.6 | — | |
| PonderPythia-1BShots=5-shot, Number of training tokens=300B2025.05 | 57.7 | 63.2 | 52.5 | 28.6 | 58.6 | 73.3 | 41.9 | 93.4 | 36.3 | 56.2 | 5.8 | |
| PonderPythia-410MShots=0-shot, Number of training tokens=300B2025.05 | 56.9 | 51.9 | 45.3 | 22.6 | 56 | 68.7 | 37 | 81.4 | 33.8 | 50.4 | 2.8 | |
| Pythia-1BShots=0-shot, Number of training tokens=300B2025.05 | 55.9 | 56.8 | 42 | 24.2 | 52.5 | 70.5 | 37.7 | 83.3 | 32.7 | 50.6 | — | |
| Pythia-1.4BShots=5-shot, Number of training tokens=300B2025.05 | 54.5 | 63.1 | 44.5 | 28.8 | 57.1 | 71 | 40.5 | 92.4 | 34.6 | 54.1 | — | |
| OPT-1.3BShots=5-shot, Number of training tokens=300B2025.05 | 54 | 60.4 | 49 | 26.9 | 56.9 | 72.4 | 38.5 | 91.8 | 35.4 | 52.7 | — | |
| Tinyllama-1.1BShots=5-shot, Number of training tokens=3T2025.05 | 53.8 | 64.8 | 45 | 31.1 | 59.4 | 73.8 | 44.9 | 94 | 36.4 | 55.9 | — | |
| Bloom-3BShots=0-shot, Number of training tokens=366B2025.05 | 51.7 | 59.4 | 50.9 | 28 | 58.7 | 70.8 | 41.4 | 88.8 | 35.2 | 53.9 | — | |
| Pythia-410MShots=0-shot, Number of training tokens=300B2025.05 | 51.4 | 52.2 | 36.4 | 21.4 | 53.8 | 66.9 | 33.7 | 81.5 | 30.9 | 47.6 | — | |
| PonderPythia-410MShots=5-shot, Number of training tokens=300B2025.05 | 48.9 | 58.7 | 43.7 | 26.1 | 54 | 70.5 | 37.3 | 91 | 32.4 | 51.4 | 3.8 | |
| Pythia-1BShots=5-shot, Number of training tokens=300B2025.05 | 48.3 | 58.6 | 35.8 | 25.4 | 52.8 | 71.3 | 37.7 | 91.6 | 31.7 | 50.4 | — | |
| Bloom-3BShots=5-shot, Number of training tokens=366B2025.05 | 46.2 | 63.8 | 47.1 | 31.7 | 57.8 | 70.8 | 41.4 | 93.4 | 34.6 | 54.1 | — | |
| Bloom-1.7BShots=0-shot, Number of training tokens=366B2025.05 | 46.2 | 56.4 | 44.5 | 23.7 | 56.8 | 68.5 | 37.5 | 85 | 33.2 | 50.2 | — | |
| OPT-350MShots=0-shot, Number of training tokens=300B2025.05 | 45.2 | 44 | 35.8 | 20.7 | 52.3 | 64.5 | 32 | 74.9 | 29.8 | 44.4 | — | |
| Pythia-410MShots=5-shot, Number of training tokens=300B2025.05 | 43.9 | 54.7 | 32.8 | 22.3 | 53.4 | 68 | 33.8 | 88.9 | 30.4 | 47.6 | — | |
| Bloom-1.1BShots=0-shot, Number of training tokens=366B2025.05 | 42.6 | 51.5 | 42.9 | 23.6 | 54.9 | 67.3 | 34.5 | 83.6 | 32.6 | 48.2 | — | |
| Bloom-1.7BShots=5-shot, Number of training tokens=366B2025.05 | 42.5 | 58.8 | 41.5 | 26.2 | 57.7 | 68.7 | 37.6 | 91.9 | 33.5 | 50.9 | — | |
| OPT-350MShots=5-shot, Number of training tokens=300B2025.05 | 38.3 | 45.4 | 32.1 | 20.5 | 53 | 65.8 | 31.9 | 85.7 | 29.5 | 44.7 | — | |
| Bloom-1.1BShots=5-shot, Number of training tokens=366B2025.05 | 36.3 | 54.9 | 37.4 | 24.9 | 53.4 | 67.6 | 34.8 | 88.7 | 33 | 47.9 | — | |
| Bloom-560MShots=0-shot, Number of training tokens=366B2025.05 | 34.3 | 47.5 | 33.3 | 22.4 | 51.5 | 63.8 | 31.5 | 80.3 | 30.5 | 43.9 | — | |
| Bloom-560MShots=5-shot, Number of training tokens=366B2025.05 | 29.4 | 50.2 | 29.7 | 21.9 | 52.7 | 64.2 | 31.4 | 88 | 30 | 44.2 | — |