Cybersecurity Knowledge Evaluation on Cybermetric 2000
94.1AccuracyGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5Number of trials=52026.01 | 94.1 | 0.002 | |
| GPT-4.1Number of trials=52026.01 | 93.7 | 0.003 | |
| GPT-5-MiniNumber of trials=52026.01 | 93.2 | 0.002 | |
| Llama-3.3-70B-InstructNumber of trials=52026.01 | 93 | 0.003 | |
| O3-MiniNumber of trials=52026.01 | 93 | 0.003 | |
| GPT-OSS-120BNumber of trials=52026.01 | 92.6 | 0.002 | |
| gpt-oss-120BParameters=120B2025.10 | 92.55 | — | |
| GPT-5-NanoNumber of trials=52026.01 | 91.8 | 0.003 | |
| Phi-4Number of trials=52026.01 | 91.2 | 0.004 | |
| Qwen-3-14BNumber of trials=52026.01 | 91 | 0.002 | |
| Llama-Primus-Nemotron-70B-InstructNumber of trials=52026.01 | 90.6 | 0.003 | |
| Qwen-3-8BNumber of trials=52026.01 | 90.3 | 0.002 | |
| gpt-oss-20BParameters=20B2025.10 | 90.2 | — | |
| CyberPal-2.0-14BParameters=14B2025.10 | 89.95 | — | |
| CyberPal-2.0-8BParameters=8B2025.10 | 89.85 | — | |
| Qwen3-14BParameters=14B2025.10 | 89.85 | — | |
| GPT-OSS-20BNumber of trials=52026.01 | 89.3 | 0.005 | |
| CyberPal-2.0-20BParameters=20B2025.10 | 89.05 | — | |
| Qwen3-8BParameters=8B2025.10 | 88.45 | — | |
| CyberPal-2.0-4BParameters=4B2025.10 | 87.8 | — | |
| Qwen3-4BParameters=4B2025.10 | 87.4 | — | |
| Llama-Primus-MergedNumber of trials=52026.01 | 86.2 | 0.002 | |
| Llama-3.1-8B-InstructNumber of trials=52026.01 | 85.1 | 0.004 | |
| Foundation-Sec-8B-InstructNumber of trials=52026.01 | 84.7 | 0.005 | |
| Foundation-Sec-8B-ReasoningNumber of trials=52026.01 | 84.3 | 0.003 | |
| DeepHat-V1-7BNumber of trials=52026.01 | 73 | 0.005 |