Text-only Question Answering on MMLU (Clinical Topics)
91.6Accuracyo1
Evaluation Results
| Method | Links | |
|---|---|---|
| o1Model Category=Proprietary2026.01 | 91.6 | |
| Gemini2.5-proModel Category=Proprietary2026.01 | 89.8 | |
| GPT-4oModel Category=Proprietary2026.01 | 88.7 | |
| PulseMind-72BModel Category=Open-source, Model Scale=~72B2026.01 | 88.7 | |
| Qwen2.5VL-72BModel Category=Open-source, Model Scale=~72B2026.01 | 88.3 | |
| PulseMind-32BModel Category=Open-source, Model Scale=~32B2026.01 | 85.6 | |
| Lingshu-32BModel Category=Open-source, Model Scale=~32B2026.01 | 84.7 | |
| Qwen2.5VL-32BModel Category=Open-source, Model Scale=~32B2026.01 | 83.2 | |
| InternVL3-78BModel Category=Open-source, Model Scale=~72B2026.01 | 83 | |
| InternVL3-38BModel Category=Open-source, Model Scale=~32B2026.01 | 82.8 | |
| HuatuoGPT-vision-34BModel Category=Open-source, Model Scale=~32B2026.01 | 80.8 | |
| LLAVA-med-34BModel Category=Open-source, Model Scale=~32B2026.01 | 74.7 |