Natural Language Inference on MultiMed-X EN
78.67AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4o2026.01 | 78.67 | |
| MED-COREASONERbackbone=GPT-5.12026.01 | 77.33 | |
| GPT-5.22026.01 | 76.67 | |
| GPT-5.12026.01 | 76.67 | |
| Claude-3.5-haiku2026.01 | 69.33 |
| Method | Links | |
|---|---|---|
| GPT-4o2026.01 | 78.67 | |
| MED-COREASONERbackbone=GPT-5.12026.01 | 77.33 | |
| GPT-5.22026.01 | 76.67 | |
| GPT-5.12026.01 | 76.67 | |
| Claude-3.5-haiku2026.01 | 69.33 |