Commonsense Reasoning on HellaSwag (EN/ES Accuracy, Gaps)
68Accuracy (EN)Nemotron-3 120B
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Nemotron-3 120BEvaluation Protocol=Original (raw LL), Shots=5-shot, Scoring=raw LL, Pretrained-only=true2026.06 | 68 | 63.3 | 4.7 | — | |
| Qwen2.5 72BEvaluation Protocol=Original (raw LL), Shots=5-shot, Scoring=raw LL, Pretrained-only=true2026.06 | 65.4 | 58.5 | 6.9 | — | |
| LLaMA-3.1 70BEvaluation Protocol=Original (raw LL), Shots=5-shot, Scoring=raw LL, Pretrained-only=true2026.06 | 64.7 | 58.6 | 6.1 | — | |
| Nemotron-3 120BEvaluation Protocol=ParaEval (raw LL), Shots=5-shot, Scoring=raw LL, Pretrained-only=true2026.06 | 64.7 | 61.4 | 3.4 | 1.4 | |
| Qwen2.5 72BEvaluation Protocol=ParaEval (raw LL), Shots=5-shot, Scoring=raw LL, Pretrained-only=true2026.06 | 62.6 | 56.6 | 6 | 0.9 | |
| LLaMA-3.1 70BEvaluation Protocol=ParaEval (raw LL), Shots=5-shot, Scoring=raw LL, Pretrained-only=true2026.06 | 61.6 | 56.6 | 5 | 1.1 |