Clinical Case Diagnosis on MedCaseReasoning official (test)
0.9246AccuracySEA (Qwen-8b)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| SEA (Qwen-8b)Backbone=Qwen3-8b2026.04 | 0.9246 | 0.8681 | 0.012 | |
| SEA (Qwen-4b)Backbone=Qwen3-4b2026.04 | 0.8453 | 0.8176 | 0.015 | |
| Qwen3-8b (RL-DiagnosticRewardOnly)Protocol=Reinforcement-Learning (RL)2026.04 | 0.7732 | 0.7231 | 0.023 | |
| Qwen3-4b (RL-DiagnosticRewardOnly)Protocol=Reinforcement-Learning (RL)2026.04 | 0.7411 | 0.6954 | 0.025 | |
| Qwen3-4b (SFT)Protocol=Supervised Fine-Tuning (SFT)2026.04 | 0.7225 | 0.7012 | 0.02 | |
| Qwen3-8b (SFT)Protocol=Supervised Fine-Tuning (SFT)2026.04 | 0.721 | 0.6895 | 0.02 | |
| Qwen3-8b (SFT+ShortTerm-Memory)Protocol=Memory-Augmented2026.04 | 0.5633 | 0.5087 | 0.023 | |
| MedGemma-27BProtocol=Zeroshot2026.04 | 0.547 | 0.5113 | 0.023 | |
| Qwen3-14BProtocol=Zeroshot2026.04 | 0.5035 | 0.4289 | 0.024 | |
| OLMo3-7BProtocol=Zeroshot2026.04 | 0.4712 | 0.4385 | 0.025 | |
| Qwen3-8bProtocol=Zeroshot2026.04 | 0.4511 | 0.4187 | 0.025 | |
| Qwen3-4bProtocol=Zeroshot2026.04 | 0.432 | 0.4002 | 0.025 | |
| Qwen3-8b (ReAct+ShortTerm-Memory)Protocol=Memory-Augmented2026.04 | 0.4251 | 0.383 | 0.025 | |
| LLaMa-3.1-8BProtocol=Zeroshot2026.04 | 0.421 | 0.3978 | 0.025 |