Cybersecurity Knowledge Evaluation on MMLU Security
93.2AccuracyGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5Number of trials=52026.01 | 93.2 | 0.007 | |
| GPT-5-MiniNumber of trials=52026.01 | 88.4 | 0.014 | |
| GPT-OSS-120BNumber of trials=52026.01 | 88 | 0.019 | |
| GPT-4.1Number of trials=52026.01 | 87.2 | 0.007 | |
| Qwen-3-14BNumber of trials=52026.01 | 87 | 0.009 | |
| GPT-OSS-20BNumber of trials=52026.01 | 87 | 0.011 | |
| Llama-3.3-70B-InstructNumber of trials=52026.01 | 86.4 | 0.017 | |
| O3-MiniNumber of trials=52026.01 | 85.8 | 0.017 | |
| Qwen-3-8BNumber of trials=52026.01 | 84.6 | 0.014 | |
| Phi-4Number of trials=52026.01 | 84.4 | 0.01 | |
| GPT-5-NanoNumber of trials=52026.01 | 83.6 | 0.016 | |
| Llama-Primus-Nemotron-70B-InstructNumber of trials=52026.01 | 83.4 | 0.027 | |
| Foundation-Sec-8B-ReasoningNumber of trials=52026.01 | 78.2 | 0.023 | |
| Foundation-Sec-8B-InstructNumber of trials=52026.01 | 77 | 0.026 | |
| Llama-3.1-8B-InstructNumber of trials=52026.01 | 76.8 | 0.01 | |
| Llama-Primus-MergedNumber of trials=52026.01 | 76.2 | 0.029 | |
| DeepHat-V1-7BNumber of trials=52026.01 | 66.6 | 0.022 |