Text-only Question Answering on MedXpertQA text
48.9Accuracyo1
Evaluation Results
| Method | Links | |
|---|---|---|
| o1Model Category=Proprietary2026.01 | 48.9 | |
| PulseMind-72BModel Category=Open-source, Model Scale=~72B2026.01 | 29.8 | |
| Gemini2.5-proModel Category=Proprietary2026.01 | 24.3 | |
| Lingshu-32BModel Category=Open-source, Model Scale=~32B2026.01 | 22.7 | |
| GPT-4oModel Category=Proprietary2026.01 | 22.5 | |
| PulseMind-32BModel Category=Open-source, Model Scale=~32B2026.01 | 21.5 | |
| InternVL3-78BModel Category=Open-source, Model Scale=~72B2026.01 | 18.5 | |
| Qwen2.5VL-72BModel Category=Open-source, Model Scale=~72B2026.01 | 16.1 | |
| InternVL3-38BModel Category=Open-source, Model Scale=~32B2026.01 | 16 | |
| HuatuoGPT-vision-34BModel Category=Open-source, Model Scale=~32B2026.01 | 16 | |
| Qwen2.5VL-32BModel Category=Open-source, Model Scale=~32B2026.01 | 15.6 | |
| LLAVA-med-34BModel Category=Open-source, Model Scale=~32B2026.01 | 14.1 |