Clinical Reasoning on ER-Reason
34.4AccuracyKimi-2.6
Evaluation Results
| Method | Links | |
|---|---|---|
| Kimi-2.62026.05 | 34.4 | |
| Claude-Haiku-4.52026.05 | 34.3 | |
| GPT-5.02026.05 | 33.7 | |
| Llama-Aloe-Beta-8B2026.05 | 29.1 | |
| MedGuideX-9BBackbone=Qwen3.5-9B2026.05 | 28.7 | |
| Qwen3.5-9BPrompting Strategy=3-Shot In-Context Learning2026.05 | 28.2 | |
| RL with CPG-Derived Process RewardsBackbone=Qwen3.5-9B2026.05 | 27.8 | |
| Qwen3.5-9BPrompting Strategy=RAG with Guidelines2026.05 | 27.4 | |
| Qwen3.5-4BPrompting Strategy=RAG with Guidelines2026.05 | 26.3 | |
| Lingshu-7B2026.05 | 26.2 | |
| Qwen3.5-4BPrompting Strategy=3-Shot In-Context Learning2026.05 | 26.1 | |
| MedGuideX-4BBackbone=Qwen3.5-4B2026.05 | 25.9 | |
| Qwen3.5-9BPrompting Strategy=Zero-shot2026.05 | 25.7 | |
| BioMistral-7B2026.05 | 24.8 | |
| DeepSeek-V42026.05 | 24 | |
| Qwen3.5-4BPrompting Strategy=Zero-shot2026.05 | 23.6 | |
| MedReason-8B2026.05 | 22.4 | |
| MediPhi-Instruct-4B2026.05 | 22.2 | |
| Hulu-Med-7B2026.05 | 22.2 | |
| HuatuoGPT-o1-8B2026.05 | 22 | |
| Fine-tuning with CPGBackbone=Qwen3.5-9B2026.05 | 21.5 | |
| Llava-Med-v1.5-7B2026.05 | 21.2 | |
| MedGemma-1.5-4B2026.05 | 20.8 | |
| CPGPromptBackbone=Qwen3.5-9B2026.05 | 19.9 | |
| Clinical-R1-3B2026.05 | 19.1 | |
| MedAlpaca-7B2026.05 | 11 |