Public Health Specialized Reasoning on GlobalHealthAtlas representative subset (test)
7.326Scoreglm-4.7
Evaluation Results
| Method | Links | |||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| glm-4.7Series=Other Mainstream Open-Source Series2026.01 | 7.326 | 7.49 | 7.175 | 7.433 | 8.432 | 7.314 | 7.351 | 7.545 | 8.108 | 7.019 | 7.525 | 8.484 | 6.151 | |
| kimi-k2-thinkingSeries=Reasoning & Thinking Models2026.01 | 6.93 | 7.023 | 6.806 | 6.945 | 7.927 | 6.985 | 7.188 | 7.153 | 7.632 | 6.659 | 7.001 | 7.912 | 5.917 | |
| Public-ModelBase Model=qwen3-8b, Series=qwen Series2026.01 | 6.619 | 6.696 | 6.566 | 6.541 | 8.022 | 6.702 | 6.857 | 6.735 | 7.595 | 6.23 | 6.954 | 8.063 | 5.141 | |
| claude-sonnet-4-5-20250929-thinkingSeries=Reasoning & Thinking Models2026.01 | 6.534 | 6.553 | 6.427 | 6.585 | 7.139 | 6.635 | 6.622 | 6.382 | 6.856 | 6.416 | 6.48 | 7.006 | 6.047 | |
| deepseek-v3.2Series=DeepSeek Series2026.01 | 6.365 | 6.471 | 6.221 | 6.448 | 6.914 | 6.278 | 6.089 | 6.847 | 6.897 | 6.159 | 6.448 | 7.142 | 5.569 | |
| grok-3-miniSeries=Reasoning & Thinking Models2026.01 | 6.352 | 6.478 | 6.187 | 6.41 | 6.997 | 6.343 | 6.35 | 6.683 | 6.884 | 6.148 | 6.413 | 7.133 | 5.551 | |
| deepseek-r1Series=DeepSeek Series2026.01 | 6.335 | 6.47 | 6.18 | 6.414 | 7.217 | 6.316 | 6.271 | 6.661 | 7.007 | 6.068 | 6.554 | 7.308 | 5.341 | |
| gemini-3-flash-preview-thinkingSeries=Reasoning & Thinking Models2026.01 | 6.282 | 6.344 | 6.212 | 6.343 | 6.506 | 6.284 | 6.498 | 6.388 | 6.499 | 6.194 | 6.328 | 6.625 | 5.911 | |
| deepseek-r1-distill-qwen-32bSeries=DeepSeek Series2026.01 | 6.238 | 6.326 | 6.148 | 6.245 | 7.122 | 6.23 | 6.091 | 6.487 | 6.893 | 5.983 | 6.373 | 7.237 | 5.215 | |
| qwq-32bSeries=qwen Series2026.01 | 6.173 | 6.286 | 6.038 | 6.223 | 6.937 | 6.175 | 6.104 | 6.348 | 6.809 | 5.922 | 6.34 | 7.127 | 5.194 | |
| qwen3-8bSeries=qwen Series2026.01 | 5.934 | 6.034 | 5.822 | 5.922 | 6.906 | 5.956 | 6.028 | 6.09 | 6.648 | 5.65 | 6.158 | 6.987 | 4.855 | |
| deepseek-r1-distill-llama-8bSeries=DeepSeek Series2026.01 | 5.822 | 5.873 | 5.765 | 5.678 | 6.715 | 5.892 | 5.491 | 6.028 | 6.473 | 5.573 | 5.961 | 6.785 | 4.84 | |
| Llama-3.1-8B-InstructSeries=Other Mainstream Open-Source Series2026.01 | 5.464 | 5.539 | 5.394 | 5.386 | 6.689 | 5.406 | 5.696 | 5.854 | 6.261 | 5.149 | 5.666 | 6.722 | 4.174 | |
| Llama-3.2-3B-InstructSeries=Other Mainstream Open-Source Series2026.01 | 5.276 | 5.38 | 5.233 | 5.115 | 6.453 | 5.465 | 5.311 | 5.224 | 6.183 | 4.925 | 5.421 | 6.589 | 3.933 | |
| qwen3-32bSeries=qwen Series2026.01 | 5.259 | 5.247 | 5.309 | 5.064 | 6.52 | 5.415 | 5.324 | 5.276 | 5.979 | 4.977 | 5.423 | 6.357 | 4.135 | |
| deepseek-r1-distill-qwen-7bSeries=DeepSeek Series2026.01 | 5.004 | 4.947 | 5.039 | 4.891 | 5.735 | 5.091 | 5.136 | 5.123 | 5.57 | 4.78 | 5.164 | 5.899 | 4.087 | |
| qwen2.5-72b-instructSeries=qwen Series2026.01 | 4.839 | 4.768 | 4.829 | 4.874 | 4.548 | 4.869 | 4.733 | 4.951 | 4.578 | 4.941 | 4.801 | 4.578 | 5.107 | |
| qwen2.5-7b-instructSeries=qwen Series2026.01 | 3.66 | 3.852 | 3.469 | 3.696 | 4.482 | 3.634 | 3.824 | 3.985 | 4.127 | 3.468 | 3.909 | 4.418 | 2.884 | |
| gpt-5-miniSeries=Reasoning & Thinking Models2026.01 | 3.634 | 3.991 | 3.307 | 3.81 | 5.01 | 3.842 | 3.159 | 3.436 | 3.999 | 3.443 | 4.768 | 4.953 | 2.612 |