General Language Understanding on 10 Benchmarks Average (test)
67.4Accuracy (Average)Base
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| BaseModel Scale=7B2026.05 | 67.4 | — | |
| MSFTSize=Average, Evaluation Protocol=5-shot greedy decoding2026.03 | 63.7 | 4.12 | |
| IESSize=Average, Evaluation Protocol=5-shot greedy decoding2026.03 | 62.5 | 3.88 | |
| DynamixSFTSize=Average, Evaluation Protocol=5-shot greedy decoding2026.03 | 62.1 | 4.04 | |
| SFTSize=Average, Evaluation Protocol=5-shot greedy decoding2026.03 | 61.9 | 3.88 | |
| Anchored LearningModel Scale=7B2026.05 | 61.6 | — | |
| Continual SFTSize=Average, Evaluation Protocol=5-shot greedy decoding2026.03 | 59.7 | 1.71 | |
| Low-SFTModel Scale=7B2026.05 | 59.2 | — | |
| BaseModel Scale=3B2026.05 | 57.1 | — | |
| Anchored LearningModel Scale=3B2026.05 | 53.3 | — | |
| Low-SFTModel Scale=3B2026.05 | 49.6 | — | |
| BaseModel Scale=1.5B2026.05 | 45.2 | — | |
| Anchored LearningModel Scale=1.5B2026.05 | 39.5 | — | |
| Low-SFTModel Scale=1.5B2026.05 | 37.4 | — | |
| BaseSize=Average, Evaluation Protocol=5-shot greedy decoding2026.03 | 27.1 | — |