Commonsense Reasoning on Hellaswag (Perf., #D, Sp.)
55.5PerformanceBest Model
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Best Modelshot=0-shot, eval_tool=LM Eval2025.10 | 55.5 | 3 | -8.8 | |
| BSBAshot=0-shot, eval_tool=LM Eval2025.10 | 54.5 | 5 | -14.6 | |
| LLaMA 3.1 8B Baselineshot=0-shot, eval_tool=LM Eval2025.10 | 52.5 | — | — |