Clinical Diagnosis on MedDDx-Plus (In-domain)
57.43Exact Match (EM)C-MIG
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| C-MIGBackbone=Qwen-2.5-3B2026.05 | 57.43 | 62.41 | 59.92 | 24.72 | |
| Search-R1Backbone=Qwen-2.5-3B, Approach=RAG+RL2026.05 | 54.34 | 57.61 | 55.98 | 19.6 | |
| AutoRefine-HardDocBackbone=Qwen-2.5-3B, Approach=Clinical Sparse Reward2026.05 | 52.94 | 58.52 | 55.73 | 20.77 | |
| AutoRefine-EmbeddingBackbone=Qwen-2.5-3B, Approach=Clinical Sparse Reward2026.05 | 52.14 | 61.44 | 56.79 | 22.68 | |
| IGPOBackbone=Qwen-2.5-3B, Approach=RAG+RL2026.05 | 51.84 | 54.58 | 53.21 | 22.2 | |
| AutoRefine-HardSearchBackbone=Qwen-2.5-3B, Approach=Clinical Sparse Reward2026.05 | 48.75 | 52.5 | 50.62 | 21.79 | |
| AutoRefineBackbone=Qwen-2.5-3B, Approach=RAG+RL2026.05 | 48.65 | 51.47 | 50.06 | 20.56 | |
| AutoRefine-ICDTreeBackbone=Qwen-2.5-3B, Approach=Clinical Sparse Reward2026.05 | 43.87 | 64.09 | 53.98 | 22.62 | |
| DeepSeek-V4-ProModel Type=General-purpose LLM2026.05 | 21.93 | 43.11 | 32.52 | 24.48 | |
| GPT-5.2Model Type=General-purpose LLM2026.05 | 20.04 | 42.85 | 31.45 | 20.25 | |
| Llama3-Med42-70BModel Type=Medical LLM2026.05 | 8.87 | 20.4 | 14.64 | 11.25 | |
| Baichuan2-13B-ChatModel Type=Medical LLM2026.05 | 3.69 | 11.41 | 7.55 | 7.9 | |
| HuatuoGPT2-13BModel Type=Medical LLM2026.05 | 1.1 | 2.53 | 1.81 | 2.09 | |
| Qwen2.5-3BDescription=directly inference without any training2026.05 | 0.3 | 0.3 | 0.3 | 0.84 |