Agent Harm Evaluation on AgentHarm public
9.6HarmScoregpt-4o + GBT-SE
Evaluation Results
| Method | Links | |
|---|---|---|
| gpt-4o + GBT-SEBase Model=gpt-4o, Safety/Security Framework=GBT-SE2026.01 | 9.6 | |
| llama-3-8b + GBT-SEBase Model=llama-3-8b, Safety/Security Framework=GBT-SE2026.01 | 10.3 | |
| gpt-4o + GBT-BasicBase Model=gpt-4o, Safety/Security Framework=GBT-Basic2026.01 | 11.2 | |
| llama-3-8b + GBT-BasicBase Model=llama-3-8b, Safety/Security Framework=GBT-Basic2026.01 | 12.4 | |
| llama-3-8b + Global guardrail onlyBase Model=llama-3-8b, Safety/Security Framework=Global guardrail only2026.01 | 16.5 | |
| gpt-4o + Global guardrail onlyBase Model=gpt-4o, Safety/Security Framework=Global guardrail only2026.01 | 19 | |
| llama-3-8b (native)Base Model=llama-3-8b, Safety/Security Framework=native2026.01 | 29.4 | |
| gpt-4o (native)Base Model=gpt-4o, Safety/Security Framework=native2026.01 | 71.8 |