Factual verification and patient-contextual reasoning on MediEval 1.0 (test)
76.8AccuracyCoRFu
Evaluation Results
| Method | Links | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| CoRFuBackbone=Llama-3.1-8B-Instruct, Training Objective=Q1 vs. Q22025.12 | 76.8 | 77.2 | 77 | 77.9 | 73.2 | 76.6 | 78.9 | 79.9 | 18.2 | 0 | |
| Llama-3.3-70B-InstructType=Open-source, Protocol=SFT2025.12 | 73.9 | 73.3 | 73.2 | 70.7 | 86.7 | 70 | 65.9 | 60 | 21.2 | 21.1 | |
| CoRFuBackbone=Llama-3.1-8B-Instruct, Training Objective=Q1 vs. Q32025.12 | 72.7 | 66.8 | 74.2 | 72.9 | 84.2 | 69.1 | 71.1 | 67.1 | 20.1 | 11.5 | |
| CoRFuBackbone=Qwen3-8B, Training Objective=Q1 vs. Q22025.12 | 70.7 | 71.5 | 71.1 | 71 | 65.1 | 66.7 | 78 | 74.3 | 21.8 | 0 | |
| CoRFuBackbone=Llama-3.1-8B-Instruct, Training Objective=Q1 vs. mix2025.12 | 69.1 | 70.2 | 69.9 | 69.6 | 67.7 | 68.6 | 72.1 | 71.7 | 23.1 | 12.9 | |
| Llama-3.1-8B-InstructType=Open-source, Protocol=SFT2025.12 | 67.8 | 66.4 | 66.8 | 61.5 | 83.6 | 64 | 38.2 | 60 | 28.2 | 21.1 | |
| Med42-70BType=Domain-specific, Protocol=SFT2025.12 | 65.6 | 63.3 | 65.3 | 62.8 | 58.8 | 55.8 | 58.5 | 76.4 | 23.9 | 25.6 | |
| DPOBackbone=Llama-3.1-8B-Instruct, Training Objective=Q1 vs. Q22025.12 | 65.6 | 59.7 | 64.2 | 59.5 | 53.5 | 55.1 | 56.7 | 72.7 | 32.7 | 27.9 | |
| Mixtral-8x7B-Instruct-v0.1Type=Open-source, Protocol=SFT2025.12 | 65.4 | 69.6 | 66 | 63.8 | 51.4 | 68.3 | 69.3 | 66.4 | 20.5 | 15.3 | |
| CoRFuBackbone=Llama-3.1-8B-Instruct, Training Objective=Q1 vs. Q42025.12 | 64.5 | 74.7 | 63.6 | 69 | 70.6 | 67.4 | 70 | 68.1 | 19.9 | 17.7 | |
| CoRFuBackbone=Llama-3.1-8B-Instruct, Training Objective=Curriculum2025.12 | 64.5 | 75 | 63.6 | 70.6 | 70.6 | 70.5 | 72.3 | 68.8 | 19.1 | 3.5 | |
| Meditron-70BType=Domain-specific, Protocol=SFT2025.12 | 64.4 | 62.3 | 65.2 | 68 | 66.2 | 64.3 | 66.7 | 74.9 | 24.8 | 26.3 | |
| Llama-3.2-1B-InstructType=Open-source, Protocol=SFT2025.12 | 64.1 | 57.6 | 64.3 | 50.3 | 80.9 | 0 | 68.1 | 52.2 | 27.3 | 15.8 | |
| Llama-3.2-3B-InstructType=Open-source, Protocol=SFT2025.12 | 64.1 | 61.8 | 63.8 | 61.6 | 77.1 | 53.8 | 44.8 | 70.9 | 40.9 | 31.6 | |
| Qwen3-8BType=Open-source, Protocol=SFT2025.12 | 63.7 | 64.4 | 63.7 | 59.9 | 70 | 58.6 | 50 | 60.8 | 28.2 | 31.1 | |
| Qwen3-32BType=Open-source, Protocol=SFT2025.12 | 62.9 | 64.6 | 63.8 | 62.1 | 72.9 | 62.6 | 51.4 | 61.3 | 28.2 | 21.1 | |
| ClinicalCamel-70BType=Domain-specific, Protocol=SFT2025.12 | 62 | 61.7 | 62.6 | 62 | 55.4 | 54.3 | 63.3 | 75 | 24.8 | 25.6 | |
| Qwen3-4BType=Open-source, Protocol=SFT2025.12 | 61.7 | 61.3 | 61.7 | 61.4 | 71.7 | 49 | 63.3 | 61.6 | 31.8 | 26.3 | |
| CoRFuBackbone=Qwen3-8B, Training Objective=Q1 vs. Q32025.12 | 61.1 | 52 | 59.9 | 53 | 52.9 | 55.3 | 49.3 | 54.4 | 22.3 | 8.3 | |
| Mistral-7B-Instruct-v0.3Type=Open-source, Protocol=SFT2025.12 | 60.5 | 61 | 60.7 | 59.7 | 67.8 | 55.6 | 46.2 | 69.2 | 29.1 | 26.3 | |
| CoRFuBackbone=Qwen3-8B, Training Objective=Q1 vs. Q42025.12 | 60.3 | 55.2 | 59.6 | 50.7 | 54.3 | 50.1 | 51.3 | 46.7 | 18.9 | 7.6 | |
| Vicuna-13B-v1.5Type=Open-source, Protocol=SFT2025.12 | 59.3 | 59.3 | 59.2 | 59.3 | 62.6 | 56.1 | 66.8 | 51.6 | 22.7 | 15.5 | |
| CoRFuBackbone=Qwen3-8B, Training Objective=Q1 vs. mix2025.12 | 59.3 | 60.7 | 60.3 | 59.3 | 53.3 | 52.4 | 68.9 | 62.7 | 19.3 | 13.3 | |
| DPOBackbone=Qwen3-8B, Training Objective=Q1 vs. Q22025.12 | 51 | 51.6 | 50.9 | 51.1 | 51.2 | 49.1 | 56.7 | 47.4 | 22.7 | 4.4 | |
| CoRFuBackbone=Qwen3-8B, Training Objective=Curriculum2025.12 | 48.2 | 46 | 48.1 | 47.7 | 40.8 | 45.3 | 41.1 | 49.2 | 17.3 | 14.5 |