Commonsense Reasoning on Commonsense Reasoning Suite (OBQA, WinoGrande, ARC-c, ARC-e, HellaSwag, SIQA, PIQA)
29.6OBQA ScoreLLR
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| LLRModel=LLaMa-1B, Pre-training Tokens=20B, s parameter=5, Evaluation Protocol=Zero-shot2026.05 | 29.6 | 56.67 | 34.64 | 70.46 | 40.53 | 40.79 | 70.46 | 49.02 | |
| UniformModel=LLaMa-1B, Pre-training Tokens=20B, Evaluation Protocol=Zero-shot2026.05 | 28 | 55.01 | 30.72 | 66.5 | 39.29 | 40.38 | 69.75 | 47.09 | |
| SharpnessModel=LLaMa-1B, Pre-training Tokens=20B, Evaluation Protocol=Zero-shot2026.05 | 26 | 53.59 | 30.8 | 67.72 | 39.36 | 40.89 | 70.4 | 46.97 | |
| LAMBModel=LLaMa-1B, Pre-training Tokens=20B, Evaluation Protocol=Zero-shot2026.05 | 24.6 | 50.59 | 29.27 | 62.37 | 36.45 | 39.3 | 68.01 | 44.37 | |
| LARSModel=LLaMa-1B, Pre-training Tokens=20B, Evaluation Protocol=Zero-shot2026.05 | 24 | 52.25 | 27.05 | 58.71 | 33.36 | 38.18 | 67.36 | 42.99 |