Clinical NLP Tasks on CASI AE (GPT-4 score)
3.72GPT-4 ScoreGPT-3.5-turbo
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-3.5-turboModel Size=175B, Sample Size=1002023.09 | 3.72 | |
| AsclepiusModel Size=13B, Sample Size=1002023.09 | 3.36 | |
| Asclepius-RModel Size=13B, Sample Size=1002023.09 | 3.36 | |
| Asclepius-RModel Size=7B, Sample Size=1002023.09 | 3.17 | |
| Clinical-CamelModel Size=13B, Sample Size=1002023.09 | 3.15 | |
| AsclepiusModel Size=7B, Sample Size=1002023.09 | 2.97 | |
| VicunaModel Size=13B, Sample Size=1002023.09 | 2.89 | |
| ChatDoctorModel Size=7B, Sample Size=1002023.09 | 1.94 | |
| AlpacaModel Size=7B, Sample Size=1002023.09 | 1.86 | |
| MedAlpacaModel Size=7B, Sample Size=1002023.09 | 1.39 |