Data Analysis on DAEval Verified
92.82AccuracyKimi K2 Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Kimi K2 InstructModel Type=Open-sourced2026.01 | 92.82 | |
| GPT-4oModel Type=Proprietary2026.01 | 92.26 | |
| Claude Sonnet 4.5Model Type=Proprietary2026.01 | 91.71 | |
| Claude Sonnet 4Model Type=Proprietary2026.01 | 90.91 | |
| Qwen3-Coder 480BModel Type=Open-sourced2026.01 | 90.61 | |
| GPT-5.1Reasoning effort=high, Model Type=Proprietary2026.01 | 89.5 | |
| GPT-5Reasoning effort=medium, Model Type=Proprietary2026.01 | 89.5 | |
| GPT-5.1Reasoning effort=none, Model Type=Proprietary2026.01 | 87.85 | |
| Qwen3 235B InstructModel Type=Open-sourced2026.01 | 85.08 | |
| GPT-OSS-120BModel Type=Open-sourced2026.01 | 84.53 | |
| Deepseek-v3.1Model Type=Open-sourced2026.01 | 82.32 | |
| Qwen3-4B-InstructModel Type=Open-sourced2026.01 | 64.47 | |
| Qwen2.5-7B-InstructModel Type=Open-sourced2026.01 | 50.56 |