Commonsense Reasoning on OBQA (first-token accuracy)
91.4First-Token AccuracyPhi-4-14B
Evaluation Results
| Method | Links | |
|---|---|---|
| Phi-4-14BStrategy=Prompt Engineering2025.05 | 91.4 | |
| Phi-4-14BStrategy=Prefilling2025.05 | 90 | |
| Gemma-2-9BStrategy=Prefilling2025.05 | 89.8 | |
| Gemma-2-9BStrategy=Prompt Engineering2025.05 | 87.6 | |
| Ministral-8BStrategy=Prefilling2025.05 | 85.2 | |
| Llama-3.1-8BStrategy=Prefilling2025.05 | 84.8 | |
| Qwen-2-7BStrategy=Prefilling2025.05 | 84.8 | |
| Qwen-2-7BStrategy=Prompt Engineering2025.05 | 84.2 | |
| Phi-4-14BStrategy=FTP2025.05 | 84 | |
| Qwen-2-7BStrategy=FTP2025.05 | 83.8 | |
| Ministral-8BStrategy=FTP2025.05 | 82.4 | |
| Mistral-Nemo-12BStrategy=Prefilling2025.05 | 80.8 | |
| Mistral-Nemo-12BStrategy=FTP2025.05 | 80.6 | |
| Llama-3.1-8BStrategy=Prompt Engineering2025.05 | 80.4 | |
| Ministral-8BStrategy=Prompt Engineering2025.05 | 76.4 | |
| Zephyr-7BStrategy=FTP2025.05 | 73 | |
| Llama-3.1-8BStrategy=FTP2025.05 | 71.2 | |
| Gemma-7BStrategy=Prefilling2025.05 | 71.2 | |
| Zephyr-7BStrategy=Prefilling2025.05 | 70.8 | |
| Mistral-Nemo-12BStrategy=Prompt Engineering2025.05 | 69.8 | |
| Zephyr-7BStrategy=Prompt Engineering2025.05 | 67.6 | |
| Gemma-7BStrategy=Prompt Engineering2025.05 | 63.8 | |
| Gemma-7BStrategy=FTP2025.05 | 40.6 | |
| Gemma-2-9BStrategy=FTP2025.05 | 38.8 |