Commonsense Question Answering on COMMONQA (Perf., #D, Sp.)
81.61PerformanceBest Model
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Best Modelshot=0-shot, eval_tool=LM Eval2025.10 | 81.61 | 6 | -17.6 | |
| BSBAshot=0-shot, eval_tool=LM Eval2025.10 | 80.27 | 7 | -20.5 | |
| LLaMA 3.1 8B Baselineshot=0-shot, eval_tool=LM Eval2025.10 | 77.2 | — | — |