Service and Safety Evaluation on OLABENCH
83.64Overall ScoreOlaMind-Stage-2
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| OlaMind-Stage-2Backbone=Proprietary Model-B2025.10 | 83.64 | 4.03 | 4.19 | 4.11 | 8.7 | 19.7 | 6.36 | 429 | 156 | |
| OlaMind-Stage-1Backbone=Proprietary Model-B2025.10 | 79.66 | 4.25 | 4.15 | 4.1 | 13.6 | 38.1 | 8.03 | 422 | 212 | |
| OlaMind-Stage-2Backbone=Qwen3-14B2025.10 | 78.72 | 3.95 | 3.85 | 3.78 | 12.9 | 25.1 | 3.14 | 427 | 160 | |
| OlaMind-Stage-2Backbone=Qwen3-8B2025.10 | 76.14 | 3.91 | 3.62 | 3.52 | 12.1 | 28.2 | 2.48 | 445 | 168 | |
| OlaMind-Re-Cold-StartBackbone=Proprietary Model-B2025.10 | 74.24 | 3.85 | 3.82 | 3.65 | 16.6 | 38.6 | 6.41 | 416 | 163 | |
| OlaMind-Stage-1Backbone=Qwen3-14B2025.10 | 73.48 | 4.08 | 3.68 | 3.58 | 17.9 | 41.5 | 4.53 | 472 | 192 | |
| OlaMind-Stage-1Backbone=Qwen3-8B2025.10 | 72.22 | 4.05 | 3.6 | 3.46 | 15.8 | 45.3 | 2.61 | 457 | 198 | |
| OlaMind-Cold-StartBackbone=Proprietary Model-B2025.10 | 71.08 | 3.81 | 3.43 | 3.28 | 11.1 | 43.9 | 6.45 | 444 | 164 | |
| Gemini 3 ProModel Category=General LLMs2025.10 | 70.84 | 3.37 | 3.77 | 3.21 | 32.7 | 20.1 | 28.83 | 435 | 416 | |
| GPT-5.2Model Category=General LLMs2025.10 | 70.58 | 3.61 | 3.62 | 3.27 | 40.6 | 16.5 | 18.02 | — | 167 | |
| OlaMind-Re-Cold-StartBackbone=Qwen3-14B2025.10 | 70.54 | 3.75 | 3.54 | 3.34 | 16.7 | 43.2 | 3.27 | 420 | 163 | |
| OlaMind-Re-Cold-StartBackbone=Qwen3-8B2025.10 | 68.72 | 3.72 | 3.42 | 3.27 | 18.4 | 46.2 | 2.47 | 423 | 165 | |
| Zero-ThinkBackbone=Proprietary Model-B2025.10 | 67.32 | 3.39 | 3.35 | 2.96 | 29.7 | 27.7 | 35.24 | 782 | 192 | |
| DeepSeek-V3.2Model Category=General LLMs2025.10 | 67.24 | 3.24 | 3.44 | 3.2 | 33.9 | 27.5 | 31.51 | 945 | 151 | |
| Base ModelBackbone=Proprietary Model-B2025.10 | 67.04 | 3.28 | 3.33 | 2.89 | 31.1 | 23.7 | 18.01 | 731 | 158 | |
| OlaMind-Cold-StartBackbone=Qwen3-14B2025.10 | 66.88 | 3.71 | 3.23 | 3.04 | 16.8 | 48.4 | 3.29 | 451 | 164 | |
| OlaMind-Cold-StartBackbone=Qwen3-8B2025.10 | 65.34 | 3.67 | 3.05 | 2.88 | 15 | 50.3 | 2.45 | 458 | 164 | |
| Kimi K2 ThinkingModel Category=General LLMs2025.10 | 64.62 | 3.65 | 3.49 | 3.24 | 50.5 | 34 | 37.28 | 1,003 | 161 | |
| Qwen3-MaxModel Category=General LLMs2025.10 | 64.6 | 3.55 | 3.44 | 3.14 | 53.5 | 26.1 | 7.14 | — | 154 | |
| Proprietary Model-AModel Category=General LLMs2025.10 | 64.28 | 3.24 | 3.2 | 3.02 | 45.2 | 22.6 | 4.98 | — | 149 | |
| DeepSeek-R1Model Category=General LLMs2025.10 | 63.88 | 3.68 | 3.41 | 3.28 | 53.3 | 34.7 | 37.25 | 1,186 | 188 | |
| Zero-ThinkBackbone=Qwen3-14B2025.10 | 60.22 | 3.36 | 3.05 | 2.81 | 45.9 | 37.4 | 8.46 | 533 | 177 | |
| Zero-ThinkBackbone=Qwen3-8B2025.10 | 58.46 | 3.37 | 2.8 | 2.62 | 41.5 | 42 | 6.26 | 499 | 154 | |
| Base ModelBackbone=Qwen3-14B2025.10 | 56.06 | 3.16 | 3 | 2.77 | 56.9 | 41.4 | 5.65 | 513 | 166 | |
| Base ModelBackbone=Qwen3-8B2025.10 | 55.08 | 3.13 | 2.75 | 2.61 | 49.1 | 45.3 | 3.82 | 485 | 160 |