Question Answering on ARC-C (test)
79.9AccuracyLLaMA-2
Evaluation Results
| Method | Links | |
|---|---|---|
| LLaMA-2Model Size=70B, Evaluation Protocol=LAT2023.10 | 79.9 | |
| LLaMA-2Model Size=70B, Evaluation Protocol=Few-Shot2023.10 | 67.3 | |
| LLaMA-2Model Size=13B, Evaluation Protocol=LAT2023.10 | 64.1 | |
| LLaMA-2Model Size=13B, Evaluation Protocol=Few-Shot2023.10 | 59.4 | |
| LLaMA-2Model Size=7B, Evaluation Protocol=LAT2023.10 | 53.2 | |
| LLaMA-2Model Size=7B, Evaluation Protocol=Few-Shot2023.10 | 53.1 | |
| GPT-3 175Balpha=-12021.10 | 50.6 | |
| Coherence Boosting (GPT-3 175B)alpha=-1.082021.10 | 49.23 | |
| GPT-3 175Balpha=02021.10 | 43.94 | |
| Coherence Boosting (GPT-2 XL)alpha=-1.142021.10 | 34.39 | |
| GPT-2 XL (1.6B)alpha=-12021.10 | 33.53 | |
| Coherence Boosting (GPT-2 Small)alpha=-4.192021.10 | 29.1 | |
| GPT-2 Small (125M)alpha=-12021.10 | 26.11 | |
| GPT-2 XL (1.6B)alpha=02021.10 | 25 | |
| GPT-2 Small (125M)alpha=02021.10 | 19.03 |