Diagnostic Reasoning on MedCaseReasoning (test)
66.2Reasoning RecallMultiDx
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| MultiDxModel Category=Agentic Method, Backbone=DeepSeek-R1, Runs=Averaged over 3 random runs2026.04 | 66.2 | 42 | 57.7 | 61.7 | |
| DeepSeek-R1Model Category=Base Model2026.04 | 64.8 | 36 | 41.9 | 44.2 | |
| MedAgentsModel Category=Agentic Method, Backbone=DeepSeek-R12026.04 | 64.1 | 34.4 | 45.8 | 47.1 | |
| Qwen3-14BModel Category=Base Model2026.04 | 63.8 | 28.4 | 29.5 | 29.5 | |
| OpenAI-DRModel Category=Agentic Method, Backbone=DeepSeek-R12026.04 | 55.7 | 41.6 | 55.3 | 60.2 | |
| Self-refinementModel Category=Agentic Method, Backbone=DeepSeek-R12026.04 | 53.5 | 33.6 | 46.2 | 49.6 | |
| Qwen-2.5-7B (SFT)Model Category=Fine-Tuned Model, Training=Supervised Fine-Tuning2026.04 | 48.6 | 24.9 | 36.3 | 42.5 | |
| LLaMA-3.1-8B-Instruct (SFT)Model Category=Fine-Tuned Model, Training=Supervised Fine-Tuning2026.04 | 48.5 | 27.8 | 41.1 | 47.9 | |
| LLaMA-3.1-8B-InstructModel Category=Base Model2026.04 | 45.1 | 16.1 | 28.1 | 33.2 | |
| Qwen-2.5-7BModel Category=Base Model2026.04 | 32.4 | 17.4 | 25.2 | 28.7 |