Radiology-specific natural language processing tasks on DRAGON 2024
81.9SDRAGON ScoreRoBERTa Large
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| RoBERTa LargeEvaluation Setting=trained directly on all 28 tasks2025.07 | 81.9 | 10 | 8 | 6 | 2 | 2 | 0 | |
| LLaMA 3.3 70BEvaluation Setting=zero-shot2025.07 | 76 | 12 | 3 | 7 | 3 | 0 | 3 | |
| Phi-4 14BEvaluation Setting=zero-shot2025.07 | 75.1 | 10 | 6 | 5 | 4 | 0 | 3 | |
| Qwen 2.5 14BEvaluation Setting=zero-shot2025.07 | 74.8 | 9 | 7 | 6 | 2 | 1 | 3 | |
| DeepSeek-R1 14BEvaluation Setting=zero-shot2025.07 | 74.4 | 9 | 6 | 5 | 5 | 1 | 2 | |
| Gemma 2 9BEvaluation Setting=zero-shot2025.07 | 68.8 | 6 | 7 | 6 | 4 | 1 | 4 | |
| Mistral-Nemo 12BEvaluation Setting=zero-shot2025.07 | 68.8 | 7 | 6 | 5 | 5 | 2 | 3 | |
| LLaMA 3.1 8BEvaluation Setting=zero-shot2025.07 | 58.8 | 3 | 4 | 4 | 4 | 5 | 8 | |
| LLaMA 3.2 3BEvaluation Setting=zero-shot2025.07 | 27.1 | 0 | 0 | 0 | 0 | 7 | 21 |