Clinical Reasoning on MedCaseReasoning
54.96AccuracyGPT-5.0
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-5.02026.05 | 54.96 | |
| DeepSeek-V42026.05 | 52.51 | |
| MedGuideX-9BBackbone=Qwen3.5-9B2026.05 | 41.36 | |
| Claude-Haiku-4.52026.05 | 40.02 | |
| RL with CPG-Derived Process RewardsBackbone=Qwen3.5-9B2026.05 | 37.68 | |
| MedGuideX-4BBackbone=Qwen3.5-4B2026.05 | 35.34 | |
| Qwen3.5-9BPrompting Strategy=3-Shot In-Context Learning2026.05 | 33.11 | |
| Qwen3.5-9BPrompting Strategy=Zero-shot2026.05 | 32.66 | |
| Qwen3.5-9BPrompting Strategy=RAG with Guidelines2026.05 | 31.88 | |
| Hulu-Med-7B2026.05 | 31.22 | |
| Fine-tuning with CPGBackbone=Qwen3.5-9B2026.05 | 28.87 | |
| Qwen3.5-4BPrompting Strategy=Zero-shot2026.05 | 28.65 | |
| Qwen3.5-4BPrompting Strategy=3-Shot In-Context Learning2026.05 | 28.65 | |
| Qwen3.5-4BPrompting Strategy=RAG with Guidelines2026.05 | 28.54 | |
| MedReason-8B2026.05 | 27.76 | |
| Lingshu-7B2026.05 | 23.86 | |
| Kimi-2.62026.05 | 23.63 | |
| Llama-Aloe-Beta-8B2026.05 | 21.18 | |
| HuatuoGPT-o1-8B2026.05 | 19.29 | |
| BioMistral-7B2026.05 | 17.28 | |
| MediPhi-Instruct-4B2026.05 | 17.06 | |
| Llava-Med-v1.5-7B2026.05 | 16.72 | |
| MedGemma-1.5-4B2026.05 | 16.39 | |
| CPGPromptBackbone=Qwen3.5-9B2026.05 | 14.16 | |
| Clinical-R1-3B2026.05 | 13.6 | |
| MedAlpaca-7B2026.05 | 12.26 |