Biomedical Question Answering on Four biomedical QA datasets macro-averaged (test)
85.3FaithfulnessMed42-Llama3-8B
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Med42-Llama3-8BFramework=MedRAGChecker2026.01 | 85.3 | 6.3 | 6.8 | |
| Med-Qwen2-7BFramework=MedRAGChecker2026.01 | 81.4 | 8 | 7.7 | |
| Meditron3-8BFramework=MedRAGChecker2026.01 | 71.5 | 7.6 | 8.2 | |
| PMC-LLaMA-13BFramework=MedRAGChecker2026.01 | 60.1 | 10.7 | 11.3 |