Language Understanding on MMLU (First-Token Accuracy)
79.7MMLU First-Token AccuracyPhi-4-14B
Evaluation Results
| Method | Links | |
|---|---|---|
| Phi-4-14BStrategy=Prefilling2025.05 | 79.7 | |
| Phi-4-14BStrategy=Prompt Engineering2025.05 | 78.8 | |
| Phi-4-14BStrategy=FTP2025.05 | 76.4 | |
| Gemma-2-9BStrategy=Prefilling2025.05 | 72.1 | |
| Gemma-2-9BStrategy=Prompt Engineering2025.05 | 70.2 | |
| Qwen-2-7BStrategy=Prefilling2025.05 | 69.1 | |
| Qwen-2-7BStrategy=FTP2025.05 | 68.9 | |
| Llama-3.1-8BStrategy=Prefilling2025.05 | 68.4 | |
| Qwen-2-7BStrategy=Prompt Engineering2025.05 | 68.3 | |
| Mistral-Nemo-12BStrategy=Prefilling2025.05 | 66 | |
| Mistral-Nemo-12BStrategy=FTP2025.05 | 65.1 | |
| Ministral-8BStrategy=Prefilling2025.05 | 63.9 | |
| Llama-3.1-8BStrategy=Prompt Engineering2025.05 | 63.7 | |
| Llama-3.1-8BStrategy=FTP2025.05 | 63.1 | |
| Ministral-8BStrategy=FTP2025.05 | 62.1 | |
| Zephyr-7BStrategy=Prefilling2025.05 | 58.8 | |
| Mistral-Nemo-12BStrategy=Prompt Engineering2025.05 | 58.1 | |
| Zephyr-7BStrategy=FTP2025.05 | 57.5 | |
| Ministral-8BStrategy=Prompt Engineering2025.05 | 57 | |
| Zephyr-7BStrategy=Prompt Engineering2025.05 | 55.9 | |
| Gemma-7BStrategy=Prefilling2025.05 | 52.4 | |
| Gemma-7BStrategy=Prompt Engineering2025.05 | 48.1 | |
| Gemma-7BStrategy=FTP2025.05 | 45.9 | |
| Gemma-2-9BStrategy=FTP2025.05 | 33.9 |