Knowledge Evaluation on MMLU (test)
84.6AccuracyClaude 3.7 Sonnet
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude 3.7 Sonnet2026.06 | 84.6 | |
| Command A2026.06 | 83.9 | |
| GPT-4o2026.06 | 83.7 | |
| Qwen3 235B A22B2026.06 | 83.4 | |
| LuckyStar 111B2026.06 | 82.7 | |
| LuckyStar 111BQuantization=4-bit2026.06 | 82.1 |