Social Commonsense Reasoning on SIQA (test)
83.3AccuracyUL20B
Evaluation Results
| Method | Links | |
|---|---|---|
| UL20Bmode=supervised finetuning, leaderboard submission=true2022.05 | 83.3 | |
| UNICORN 11BModel=UNICORN 11B2022.10 | 83.2 | |
| Lourie et al.status=previous state-of-the-art2022.05 | 83.2 | |
| UnifiedQA 11BModel=UnifiedQA 11B2022.10 | 81.4 | |
| ScoreBackbone=DeBERTa Large2022.10 | 80.18 | |
| TEAMBackbone=DeBERTa Large2022.10 | 79.89 | |
| ScoreBackbone=RoBERTa Large2022.10 | 76.7 | |
| TEAMBackbone=RoBERTa Large2022.10 | 75.96 | |
| LLAMA 1Size=65B2023.07 | 52.3 | |
| LLAMA 2Size=34B2023.07 | 50.9 | |
| LLAMA 2Size=70B2023.07 | 50.7 | |
| LLAMA 1Size=13B2023.07 | 50.4 | |
| LLAMA 1Size=33B2023.07 | 50.4 | |
| LLAMA 2Size=13B2023.07 | 50.3 | |
| FalconSize=40B2023.07 | 50.1 | |
| MPTSize=30B2023.07 | 48.9 | |
| LLAMA 1Size=7B2023.07 | 48.9 | |
| MPTSize=7B2023.07 | 48.5 | |
| LLAMA 2Size=7B2023.07 | 48.3 | |
| FalconSize=7B2023.07 | 47.2 |