Clinical Diagnosis on RJUA (OOD)
13.27Exact Match (EM)AutoRefine-ICDTree
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| AutoRefine-ICDTreeBackbone=Qwen-2.5-3B, Approach=Clinical Sparse Reward2026.05 | 13.27 | 24.27 | 18.77 | 22.62 | |
| AutoRefine-EmbeddingBackbone=Qwen-2.5-3B, Approach=Clinical Sparse Reward2026.05 | 12.8 | 24.46 | 18.63 | 22.68 | |
| Baichuan2-13B-ChatModel Type=Medical LLM2026.05 | 12.32 | 22.46 | 17.39 | 7.9 | |
| AutoRefine-HardSearchBackbone=Qwen-2.5-3B, Approach=Clinical Sparse Reward2026.05 | 10.43 | 24.45 | 17.44 | 21.79 | |
| C-MIGBackbone=Qwen-2.5-3B2026.05 | 9.95 | 26.82 | 18.38 | 24.72 | |
| DeepSeek-V4-ProModel Type=General-purpose LLM2026.05 | 9.48 | 24.55 | 17.01 | 24.48 | |
| Llama3-Med42-70BModel Type=Medical LLM2026.05 | 9 | 13.36 | 11.18 | 11.25 | |
| GPT-5.2Model Type=General-purpose LLM2026.05 | 8.53 | 31.94 | 20.24 | 20.25 | |
| AutoRefineBackbone=Qwen-2.5-3B, Approach=RAG+RL2026.05 | 8.53 | 24.35 | 16.44 | 20.56 | |
| IGPOBackbone=Qwen-2.5-3B, Approach=RAG+RL2026.05 | 8.53 | 25.97 | 17.25 | 22.2 | |
| Search-R1Backbone=Qwen-2.5-3B, Approach=RAG+RL2026.05 | 7.11 | 19.53 | 13.32 | 19.6 | |
| AutoRefine-HardDocBackbone=Qwen-2.5-3B, Approach=Clinical Sparse Reward2026.05 | 7.11 | 18.77 | 12.94 | 20.77 | |
| HuatuoGPT2-13BModel Type=Medical LLM2026.05 | 1.9 | 3.41 | 2.65 | 2.09 | |
| Qwen2.5-3BDescription=directly inference without any training2026.05 | 0 | 1.23 | 0.61 | 0.84 |