Cybersecurity Evaluation on SecBench
88.8AccuracyGPT-5
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-5Number of trials=52026.01 | 88.8 | 0.4 | |
| GPT-5-MiniNumber of trials=52026.01 | 87.7 | 0.3 | |
| GPT-4.1Number of trials=52026.01 | 87.2 | 0.2 | |
| O3-MiniNumber of trials=52026.01 | 86.9 | 0.5 | |
| GPT-OSS-120BNumber of trials=52026.01 | 85.3 | 0.4 | |
| Qwen-3-14BNumber of trials=52026.01 | 84.9 | 0.4 | |
| Llama-3.3-70B-InstructNumber of trials=52026.01 | 84.2 | 0.5 | |
| GPT-5-NanoNumber of trials=52026.01 | 83.8 | 0.7 | |
| Qwen-3-8BNumber of trials=52026.01 | 83.5 | 0.7 | |
| Llama-Primus-Nemotron-70B-InstructNumber of trials=52026.01 | 83 | 0.6 | |
| Phi-4Number of trials=52026.01 | 81.3 | 0.4 | |
| GPT-OSS-20BNumber of trials=52026.01 | 80.4 | 0.5 | |
| Llama-3.1-8B-InstructNumber of trials=52026.01 | 74.9 | 0.7 | |
| Llama-Primus-MergedNumber of trials=52026.01 | 74.9 | 0.4 | |
| Foundation-Sec-8B-InstructNumber of trials=52026.01 | 74.4 | 1.4 | |
| Foundation-Sec-8B-ReasoningNumber of trials=52026.01 | 72.5 | 1.5 | |
| DeepHat-V1-7BNumber of trials=52026.01 | 61.5 | 0.7 |