Medical Reasoning on MedXpert
19.3AccuracyMedVerse
Evaluation Results
| Method | Links | |
|---|---|---|
| MedVerseBackbone=LLaMA-3.1-8B-Instruct2026.02 | 19.3 | |
| MedReasonBackbone=LLaMA-3.1-8B-Instruct2026.02 | 18.4 | |
| OursModel=Qwen2.5-7B-Instruct, Training=Finetuning, Sample size=1000 examples2026.06 | 18.1 | |
| Huatuo-o1Backbone=LLaMA-3.1-8B-Instruct2026.02 | 16.8 | |
| Middle PerplexityModel=Qwen2.5-7B-Instruct, Training=Finetuning, Sample size=1000 examples2026.06 | 16.6 | |
| Embedding DiversityModel=Qwen2.5-7B-Instruct, Training=Finetuning, Sample size=1000 examples2026.06 | 15.8 | |
| MedVerseBackbone=Qwen2.5-7B-Instruct2026.02 | 15.3 | |
| m1kModel=Qwen2.5-7B-Instruct, Training=Finetuning, Sample size=1000 examples2026.06 | 15.3 | |
| RandomModel=Qwen2.5-7B-Instruct, Training=Finetuning, Sample size=1000 examples2026.06 | 15.1 | |
| S2LModel=Qwen2.5-7B-Instruct, Training=Finetuning, Sample size=1000 examples2026.06 | 15.1 | |
| LearnabilityModel=Qwen2.5-7B-Instruct, Training=Finetuning, Sample size=1000 examples2026.06 | 14.7 | |
| MedReasonBackbone=Qwen2.5-7B-Instruct2026.02 | 14.5 | |
| Original (LLaMA-3.1-8B-Instruct)Backbone=LLaMA-3.1-8B-Instruct2026.02 | 13.2 | |
| Original (Qwen2.5-7B-Instruct)Backbone=Qwen2.5-7B-Instruct2026.02 | 12.3 |