General Competency Assessment on General-Bench
85.1Average ScoreClaude-Haiku-4.5
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude-Haiku-4.5Model Scale=>100B2026.07 | 85.1 | |
| Qwen3.5-FlashModel Scale=>100B2026.07 | 84.42 | |
| GPT-5.4-MiniModel Scale=>100B2026.07 | 80.72 | |
| Gemini-3.1-FlashModel Scale=>100B2026.07 | 80.25 | |
| Doubao-Seed-2-LiteModel Scale=>100B2026.07 | 80.13 | |
| Deepseek-V3.2Model Scale=>100B2026.07 | 78.02 | |
| Gemma-3-27BModel Scale=10B<Scale<100B2026.07 | 75.71 | |
| FitOne-32BModel Scale=32B2026.07 | 75.19 | |
| GPT-OSS-20BModel Scale=10B<Scale<100B2026.07 | 74.76 | |
| GLM-4-32B-0414Model Scale=10B<Scale<100B2026.07 | 73.49 | |
| Qwen3-30B-A3BModel Scale=10B<Scale<100B2026.07 | 72.76 | |
| Qwen3-32BModel Scale=32B2026.07 | 72.67 | |
| FitOne-8BModel Scale=8B2026.07 | 70.83 | |
| Qwen3-8BModel Scale=8B2026.07 | 67.9 | |
| GLM-4-9B-0414Model Scale=9B2026.07 | 62.27 | |
| InternLM3-8BModel Scale=8B2026.07 | 55.35 | |
| Llama-3.1-8BModel Scale=8B2026.07 | 52.41 | |
| Ministral-3-8BModel Scale=8B2026.07 | 50.93 |