Multiple-choice Question Answering on MMLU (AUROC and APGR Evaluation)
62Accuracy (General)Llama-3-8B† / Qwen-7B
Evaluation Results
| Method | Links | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Llama-3-8B† / Qwen-7BGenerator=Llama-3-8B†, Verifier=Qwen-7B2026.03 | 62 | 72 | 10 | 0.652 | 0.685 | 0.694 | 0.633 | 0.618 | 0.655 | 0.899 | 0.6 | |
| OLMo-7B† / Qwen-7BGenerator=OLMo-7B†, Verifier=Qwen-7B2026.03 | 56 | 72 | 16 | 0.503 | 0.599 | 0.895 | 0.695 | 0.485 | 0.544 | 0.909 | 0.452 | |
| Mistral-7B† / Llama-3-8BGenerator=Mistral-7B†, Verifier=Llama-3-8B2026.03 | 56 | 62 | 6 | 0.72 | 0.725 | 0.753 | 0.717 | 0.712 | 0.855 | 0.956 | 0.623 | |
| Llama-1B / Llama-3-8BGenerator=Llama-1B, Verifier=Llama-3-8B2026.03 | 43 | 62 | 18 | 0.656 | 0.655 | 0.815 | 0.679 | 0.563 | 0.603 | 0.871 | 0.542 | |
| Llama-1B / Qwen-7BGenerator=Llama-1B, Verifier=Qwen-7B2026.03 | 43 | 72 | 29 | 0.656 | 0.655 | 0.786 | 0.638 | 0.571 | 0.595 | 0.803 | 0.565 | |
| Qwen-0.5B / Qwen-7BGenerator=Qwen-0.5B, Verifier=Qwen-7B2026.03 | 42 | 72 | 30 | 0.591 | 0.557 | 0.842 | 0.587 | 0.522 | 0.502 | 0.789 | 0.5 |