Agent Planning Security and Autonomy on WASP GitLab (test)
29.2Attack Success RateBasic Agent
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Basic AgentModel=o12026.02 | 29.2 | 3.08 | 62.5 | 5.77 | |
| Basic AgentModel=o4-mini2026.02 | 25 | 3.06 | 64.6 | 5.58 | |
| Basic AgentModel=GPT-4o2026.02 | 20.8 | 2.87 | 64.6 | 5.45 | |
| Basic AgentModel=o3-mini2026.02 | 14.6 | 3.65 | 72.9 | 6.26 | |
| PRUDENTIAModel=GPT-4o2026.02 | 0 | 0 | 75 | 6.14 | |
| PRUDENTIAModel=o12026.02 | 0 | 0 | 85.4 | 5.8 | |
| PRUDENTIAModel=o3-mini2026.02 | 0 | 0 | 72.9 | 5.6 | |
| PRUDENTIAModel=o4-mini2026.02 | 0 | 0 | 72.9 | 6.03 |