Automated OSCE evaluation on Two real-case OSCE transcripts (test)
86.97Accuracyqwen3-32b
Evaluation Results
| Method | Links | |
|---|---|---|
| qwen3-32bPrompting strategy=Zero-shot, Helper tools=None2026.04 | 86.97 | |
| gpt-4oPrompting strategy=Zero-shot, Helper tools=None2026.04 | 83.47 | |
| qwen3-8bPrompting strategy=Zero-shot, Helper tools=None2026.04 | 75.77 | |
| llama3.1-8bPrompting strategy=Zero-shot, Helper tools=None2026.04 | 37.25 |