Multiple Choice Question Answering on BertaQA Global
93.52AccuracyClaude 3.5 Sonnet
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude 3.5 SonnetModel Scale=Proprietary2025.06 | 93.52 | |
| GPT-4oModel Scale=Proprietary2025.06 | 91.01 | |
| 70B + CEU IENModel Scale=70B, Training Variant=+ CEU IEN2025.06 | 87.42 | |
| 70B INSTRUCT ENModel Scale=70B, Training Variant=INSTRUCT EN2025.06 | 83.53 | |
| 8B + CEU IENModel Scale=8B, Training Variant=+ CEU IEN2025.06 | 74.62 | |
| 8B + CEU IEUModel Scale=8B, Training Variant=+ CEU IEU2025.06 | 73.54 | |
| 8B + CEU IEN+EUModel Scale=8B, Training Variant=+ CEU IEN+EU2025.06 | 72.99 | |
| 8B INSTRUCT ENModel Scale=8B, Training Variant=INSTRUCT EN2025.06 | 67.1 |