Commonsense Reasoning on HellaSwag (Accuracy, Delta Accuracy)
32.98AccuracyAGoQ
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AGoQModel=LLaMA3.2-1B, Training Tokens=10B tokens, Evaluation Protocol=Zero-shot2026.05 | 32.98 | 0.22 | |
| Megatron-LM FP16 BaselineModel=LLaMA3.2-1B, Training Tokens=10B tokens, Evaluation Protocol=Zero-shot2026.05 | 32.76 | — | |
| AGoQModel=LLaMA2-7B, Training Tokens=2B tokens, Evaluation Protocol=Zero-shot2026.05 | 28.97 | 0.11 | |
| Megatron-LM FP16 BaselineModel=LLaMA2-7B, Training Tokens=2B tokens, Evaluation Protocol=Zero-shot2026.05 | 28.86 | — |