Commonsense Reasoning on PIQA (Accuracy, Delta Accuracy)
62.84AccuracyAGoQ
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| AGoQModel=LLaMA3.2-1B, Training Tokens=10B tokens, Evaluation Protocol=Zero-shot2026.05 | 62.84 | 0.0065 | |
| Megatron-LM FP16 BaselineModel=LLaMA3.2-1B, Training Tokens=10B tokens, Evaluation Protocol=Zero-shot2026.05 | 62.19 | — | |
| AGoQModel=LLaMA2-7B, Training Tokens=2B tokens, Evaluation Protocol=Zero-shot2026.05 | 60.39 | 0.0049 | |
| Megatron-LM FP16 BaselineModel=LLaMA2-7B, Training Tokens=2B tokens, Evaluation Protocol=Zero-shot2026.05 | 59.9 | — |