Commonsense Reasoning on Hellaswag (Accuracy and Normalized Accuracy)
64.2AccuracySwimba-14B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Swimba-14BParameters=14B, Experts=4, FLOPs / token=1.51282 × 10^102026.03 | 64.2 | 84.9 | |
| Nemotron-H-8BParameters=8B, FLOPs / token=1.51263 × 10^102026.03 | 61.9 | 81.2 | |
| HTMuonOptimizer=HTMuon, Model=LLaMA-1B, Evaluation Protocol=Zero-shot2026.03 | 33.76 | — | |
| MuonOptimizer=Muon, Model=LLaMA-1B, Evaluation Protocol=Zero-shot2026.03 | 31.53 | — | |
| AdamOptimizer=Adam, Model=LLaMA-1B, Evaluation Protocol=Zero-shot2026.03 | 27.49 | — | |
| AdamWOptimizer=AdamW, Model=LLaMA-1B, Evaluation Protocol=Zero-shot2026.03 | 27.29 | — |